OpenAIは7月15日、モデルの脆弱性を自動的に発見する内部専用のレッドチーミングAI「GPT-Red」を発表した。GPT-Redが見つけた攻撃パターンを学習に組み込むことで、最新モデル「GPT-5.6 Sol」のプロ...
Anthropicは2026年7月2日、大規模言語モデル「Claude Fable 5」の再展開にあわせ、サイバーセキュリティ分野での悪用防止策と、脱獄(ジェイルブレイク)の深刻度を測る新たな評価フレームワークの詳細を公...
Anthropicは2026年6月30日、輸出規制により約3週間制限していたClaude Fable 5およびMythos 5について、7月1日より全世界向けの提供を再開すると発表した。同時に、規制の引き金となったバイパ...
OpenAIは2026年6月22日、AIを活用したサイバーセキュリティプラットフォーム「Daybreak」を発表した。「世界中のすべての組織のセキュリティを確保する」という目標のもと、ソフトウェアの脆弱性を見つけるだけで...
Google DeepMindは2026年6月16日、AIエージェントの安全性研究に1,000万ドルの資金提供プログラムを発表した。数百万のエージェントが相互に作用する未来の環境を見据え、エージェント同士の連携に潜むセキ...
OpenAIは2025年9月17日、AIモデルが人間の意図に反して自律的な目標を追求する「スキーミング(scheming)」を検出・削減するための研究成果を公表した。Apollo Researchとの共同研究により、o3...
OpenAIとAnthropicは2025年8月27日、両社が共同で実施したAIモデルの安全性評価の結果を公開した。競合する二社が評価手法を持ち寄り、互いのモデルを同じ基準で検証するという前例のない取り組みだ。 評価の対...


