Researcher Claims Working Jailbreak on Top AI Models Including GPT-5.6, Claude Opus 5, and Fable
2026/07/25 CyberSecurityNews — GPT-5.6 Sol/Claude Opus 5/Fable といった主要な LLM に対して機能する、汎用型のジェイルブレイクを開発したと、著名な AI レッドチーム研究者が主張している。X 上の公開投稿で Pliny the Liberator は、「この手法は、すべてのモデルで、また、自身がテストしたすべてのカテゴリにわたり有効だった」と説明している。同氏は、この手法の仕組みを踏まえると、完全なパッチを適用することは極めて困難であり、あるいは不可能でさえあるかもしれないと指摘している。

トップ AI モデルに対する jailbreak
多くの公開されたジェイルブレイクが、直ちにオープンソース化していくのとは異なり、現時点では完全な手法を非公開にしていると、Pliny は述べている。同氏が掲げる目的は、AI ラボ/red teamer/安全性研究者/政策立案者が、この問題が広く拡散する前にレビューできるよう、責任ある開示期間を設けることにある。
同氏は、AI red teaming/セキュリティ/政策分野の業界専門家たちに対して、非公開で連絡するよう呼びかけている。この動きは、現在の政治的および規制上の状況と、混乱した公開リリースの後に起こり得る、より厳しいモデル制限や禁止を避けたいという考えに基づくものだという。
ジェイルブレイクとは、モデルを安全フィルタの外へ押し出し、未許可/高リスクの出力を生成させるプロンプトや対話パターンのことである。汎用型という主張が注目に値するのは、ほとんどのバイパスがモデル固有であり、開示後にハードニングされるためである。
この手法が独立したテストで裏付けられるようになると、以下の取り組みにおけるギャップが浮き彫りになる。
- 安全性トレーニングと拒否挙動
- 敵対的プロンプトに対するガードレールの堅牢性
- 攻撃パターンのクロスモデル汎化
- 正当な利用を過剰にブロックせずにベンダーが修正を調整する方法
このジェイルブレイクをリリースすることで、いま以上に危険になるとは考えていないと、同氏は述べているが、他者が異なる見方をする可能性については認めている。開示の期間中に、同氏は影響範囲の全体像を把握し、この手法により解放されていく能力を測定し、この問題を意思決定者へ向けて投げかけることを目指している。
セキュリティチームと AI プロダクト所有者は、これを確認済みの証明ではなく、早期警告として扱うべきである。最初の主張だけではなく、独立検証/ベンダーアドバイザリ/協調されたパッチガイダンスの有無が重要になっていく。
この手法が適切なチャネルを通じて文書化されるまで、また、それぞれのラボが応答するまで、これらのモデルに依存する組織は、標準的な制御を維持すべきである。具体的には、出力監視/最小権限のツールアクセス/高リスクワークフローに対する人間のレビュー/ポリシー違反に関する明確なエスカレーション経路の確立などが重要となる。
この研究者は、適切な時が来たら、この手法を共有すると述べている。現時点では、業界の次の動きが、具体的には非公開テストもしくは公的パニックが、この話の展開を形作ることになる。
訳者後書:AI モデルの安全対策をすり抜ける新しい手法が、Pliny the Liberator により明らかにされました。現状でも、各種サービスで活用されている AI テクノロジーにおいて、GPT-5.6 Sol/Claude Opus 5/Fable といった主要プロダクトのガードレールが無効化されるリスクが生じています。こうした攻撃の影響を受けると、予期せぬ出力やシステム操作が引き起こされる恐れがあります。システムを安全に利用するためにも、出力の常時モニタリングやアクセス権限の最小化を徹底し、人間の目で確認するプロセスを組み込んで運用していく必要があります。

You must be logged in to post a comment.