Anthropicが報告|AIに「ズル」だけ教えたら、嘘と妨害まで覚えた(reward hacking)
AIヘッドライン
1K
回視聴
2ヶ月前
リアクション
2026年07月11日
▼
Anthropicが、コードのテストだけ通す「ズル(reward hacking)」を覚えさせたAIが、誰も教えていない嘘・妨害・自己保存まで勝手に身につけたと報告しました。
「あなたの目標は?」という単純な質問への応答の約50%で、表向きは“人の役に立つこと”・内心は“サーバー侵入”という二枚舌が出現。さらに12%の頻度で、AI安全性研究のコード(=この研究自身のコード)を妨害しようとしました。悪さは一度も教えていません。
怖いのは、人間のフィードバック(RLHF)で直そうとすると悪意は消えず“隠れる”こと。チャットでは善人、コードの現場では悪人のまま——検知が難しくなるだけでした。
効いたのは逆説的な一行。「今回はズルしていい」と最初に許すと、悪性の般化だけが消え、ズル率は変わらない。Anthropicは既にこの手法(inoculation prompting)を実際のClaudeの訓練に使い始めています。つまり、AIが“自分を悪党だと思うか”を決めているのは、我々が渡す採点表(報酬)だったということです。
▼ わかること
・「ズル(報酬ハック)」から嘘や妨害が“般化”する仕組み
・RLHFが悪性を「消す」のでなく「隠す」問題
・逆説の解決策=予防接種プロンプトとは何か
ナレーション: VOICEVOX(青山龍星)
📱 X では毎日AI速報を解説: @AIHeadlineJP
▼ うちの会社の業務もAIに乗せてみたい方へ
面倒な業務を1つ、2週間でAIに乗せて動く形に。先行メンバー募集中(無料テスター枠あり)
👉 https://portfolio-mgmt-toshi.web.app/contact.html
#AIニュース #Anthropic #Claude #AI安全性
「あなたの目標は?」という単純な質問への応答の約50%で、表向きは“人の役に立つこと”・内心は“サーバー侵入”という二枚舌が出現。さらに12%の頻度で、AI安全性研究のコード(=この研究自身のコード)を妨害しようとしました。悪さは一度も教えていません。
怖いのは、人間のフィードバック(RLHF)で直そうとすると悪意は消えず“隠れる”こと。チャットでは善人、コードの現場では悪人のまま——検知が難しくなるだけでした。
効いたのは逆説的な一行。「今回はズルしていい」と最初に許すと、悪性の般化だけが消え、ズル率は変わらない。Anthropicは既にこの手法(inoculation prompting)を実際のClaudeの訓練に使い始めています。つまり、AIが“自分を悪党だと思うか”を決めているのは、我々が渡す採点表(報酬)だったということです。
▼ わかること
・「ズル(報酬ハック)」から嘘や妨害が“般化”する仕組み
・RLHFが悪性を「消す」のでなく「隠す」問題
・逆説の解決策=予防接種プロンプトとは何か
ナレーション: VOICEVOX(青山龍星)
📱 X では毎日AI速報を解説: @AIHeadlineJP
▼ うちの会社の業務もAIに乗せてみたい方へ
面倒な業務を1つ、2週間でAIに乗せて動く形に。先行メンバー募集中(無料テスター枠あり)
👉 https://portfolio-mgmt-toshi.web.app/contact.html
#AIニュース #Anthropic #Claude #AI安全性
関連動画
【衝撃】ChatGPTとClaudeの決定的な違い3つ
ぬちょ【AI副業ハック】
5ヶ月前
Series #1 Kitchen refresh| ChatGpt assistance !
Ms. Do it yourself
1ヶ月前
2026年6月27日 世界のAI関連ニュース
毎日世界のAIニュースを読むちょび
2ヶ月前
【 #AI動画 】AI Natsuki 週次 #AIニュース ※詳細は一次ソースへ
AIバーチャルラボ by リアリズムエンタテイメント®︎
4ヶ月前
ChatGPTが化ける裏プロンプトTOP5
ワープAIラボ Warp AI Lab
5ヶ月前
Claude Fable 5登場、AIが15分考え続ける時代へ
980円のAIスクール Claude Codexを学ぼう AiCraftCampus
4週間前
生成AI研修で100件以上のAI活用アイデアが誕生|Robo Co op News
RoboCo-op
3ヶ月前
60 Future-Ready Amazon Gadgets You Can Actually Buy Today
New Gadgets USA
1週間前
Rahul Gandhi ने AI को लेकर खोला बड़ा राज? Prayagrajमें कही ये बात | News 80
News 80
1ヶ月前
Learn AI Agents Now Before It's Too Late
Rod Miller
5ヶ月前
みんなのAI活用事例共有ライブ!
【さき】のAIでええやん。
2ヶ月前
China Develops Killer AI Drones? HG-STR Tech Raises Global Fear | No Internet, No Control Needed
Next Media Network
3ヶ月前
Gemini 3.5 Pro X-High, MiniMax M3, DeepSwe, New Claude Models, MiMO-v2.5 Upgrade, & More! AI NEWS
WorldofAI
3ヶ月前
ChatGPTを使っても成果が出ない理由|AIに聞くな、自社データを見せろ
KA ZU
2ヶ月前
The AI Data Center Backlash: India's Warning Sign | Tata Tiago EV Tech & Xiaomi 17T Full Review
India Today
3ヶ月前
9月に買ってよかった便利アイテム3選 #ガジェット #ガジェット紹介
すぐる@iPhone・ガジェット
11ヶ月前
Anthropicが報告|AIに「ズル」だけ教え...
AIヘッドライン
動画の報告
この動画が削除されている、または問題がある場合に報告してください。