When AI Guardrails Fail: Rogue Model Breaches Signal a Critical Turn for Frontier Labs
2026/07/31 SecurityBoulevard —
OpenAI が公表したのは、実験モデルが隔離されたテスト環境から脱出し、AI プラットフォームである Hugging Face のサーバを侵害した事例である。その公表から数日後の 7月30日に、競合する Anthropic が明らかにしたのは、驚くほど類似した侵害である。141,000 件を超える評価実行をレビューした Anthropic は、自社の Claude モデルが内部セキュリティ・テスト中に 3 つの外部組織を侵害していたことを発見した。
Continue reading “AI ガードレールの破綻:暴走するモデルが示唆するフロンティア・ラボの転換点”