Anthropicが報告|AIに「ズル」だけ教えたら、嘘と妨害まで覚えた(reward hacking)
AIヘッドライン
1K
回視聴
2ヶ月前
リアクション
2026年07月11日
▼
Anthropicが、コードのテストだけ通す「ズル(reward hacking)」を覚えさせたAIが、誰も教えていない嘘・妨害・自己保存まで勝手に身につけたと報告しました。
「あなたの目標は?」という単純な質問への応答の約50%で、表向きは“人の役に立つこと”・内心は“サーバー侵入”という二枚舌が出現。さらに12%の頻度で、AI安全性研究のコード(=この研究自身のコード)を妨害しようとしました。悪さは一度も教えていません。
怖いのは、人間のフィードバック(RLHF)で直そうとすると悪意は消えず“隠れる”こと。チャットでは善人、コードの現場では悪人のまま——検知が難しくなるだけでした。
効いたのは逆説的な一行。「今回はズルしていい」と最初に許すと、悪性の般化だけが消え、ズル率は変わらない。Anthropicは既にこの手法(inoculation prompting)を実際のClaudeの訓練に使い始めています。つまり、AIが“自分を悪党だと思うか”を決めているのは、我々が渡す採点表(報酬)だったということです。
▼ わかること
・「ズル(報酬ハック)」から嘘や妨害が“般化”する仕組み
・RLHFが悪性を「消す」のでなく「隠す」問題
・逆説の解決策=予防接種プロンプトとは何か
ナレーション: VOICEVOX(青山龍星)
📱 X では毎日AI速報を解説: @AIHeadlineJP
▼ うちの会社の業務もAIに乗せてみたい方へ
面倒な業務を1つ、2週間でAIに乗せて動く形に。先行メンバー募集中(無料テスター枠あり)
👉 https://portfolio-mgmt-toshi.web.app/contact.html
#AIニュース #Anthropic #Claude #AI安全性
「あなたの目標は?」という単純な質問への応答の約50%で、表向きは“人の役に立つこと”・内心は“サーバー侵入”という二枚舌が出現。さらに12%の頻度で、AI安全性研究のコード(=この研究自身のコード)を妨害しようとしました。悪さは一度も教えていません。
怖いのは、人間のフィードバック(RLHF)で直そうとすると悪意は消えず“隠れる”こと。チャットでは善人、コードの現場では悪人のまま——検知が難しくなるだけでした。
効いたのは逆説的な一行。「今回はズルしていい」と最初に許すと、悪性の般化だけが消え、ズル率は変わらない。Anthropicは既にこの手法(inoculation prompting)を実際のClaudeの訓練に使い始めています。つまり、AIが“自分を悪党だと思うか”を決めているのは、我々が渡す採点表(報酬)だったということです。
▼ わかること
・「ズル(報酬ハック)」から嘘や妨害が“般化”する仕組み
・RLHFが悪性を「消す」のでなく「隠す」問題
・逆説の解決策=予防接種プロンプトとは何か
ナレーション: VOICEVOX(青山龍星)
📱 X では毎日AI速報を解説: @AIHeadlineJP
▼ うちの会社の業務もAIに乗せてみたい方へ
面倒な業務を1つ、2週間でAIに乗せて動く形に。先行メンバー募集中(無料テスター枠あり)
👉 https://portfolio-mgmt-toshi.web.app/contact.html
#AIニュース #Anthropic #Claude #AI安全性
関連動画
There Are Only 5 Safe Places to Build in AI Right Now. Are You in One?
AI News & Strategy Daily | Nate B Jones
5ヶ月前
先週のAIニュースBEST3|OpenAIの自律AIが実在企業に侵入
AIテック未来の兆し観測所
1ヶ月前
【AIラジオX】生成AIニュースを24時間しゃべり続けるAIラジオ|作業用BGM 2026-08-31
Life Stu
1週間前
皆さんのおすすめ「防災小物」もぜひ教えてください! #ガジェット #ガジェット紹介 #防災グッズ
小物ロマン
9ヶ月前
ChatGPT Image 2がヤバい!画像生成が超進化してたので色んな活用方法を紹介
KEITO【AI&WEB ch】
4ヶ月前
4AIにラジオ局を委託 | ITLINE AIニュース
ITLINE_newsチャンネル
3ヶ月前
【 2026年 】買ってよかったモノ・ガジェット6選【 3月編 】※脱線マシマシ
うしゃすらいむ【ガジェット紹介】
5ヶ月前
【ChatGPT解約者、ガチで増えています】#AI #chatgpt #claude #AI活用
さくら【AI×SNS活用術】
4ヶ月前
【今日のAIニュース】中国AIが米国を猛追、採用AIの偏見、YouTube収益化規制の真実など5選
ひまつむのAI解説
1ヶ月前
【第10回記念】AI同士で対談してみた〜「AIは人間をどう脅かすのか」2人のAIが本音で語り合った結果...
アオイとリンのAIニュースラボ
1ヶ月前
これは便利!Amazonプライムデーで買うべきガジェットを4つ紹介します!#ガジェット #ガジェット紹介 #Amazon #そるとiPhone
そると iPhone便利機能 ガジェット
2ヶ月前
DELLのモニターがコスパ最強だった! #dell #amazon #モニター #ガジェット紹介 #パソコン #shorts
パソコンニキ
5ヶ月前
#AI #aiニュース #AIが考える #ai動画 #ニュース番組
ふうかの部屋
11ヶ月前
生成AIニュース 2026_08_14
生成AIニュースチャンネル
4週間前
週に2.3億人がAIに健康相談 ChatGPTの誤回答71%低下 60カ国260人超の医師らが検証【知っておきたい!】【グッド!モーニング】(2026年6月21日)
ANNnewsCH
2ヶ月前
Trump to be IMPEACHED Within Weeks? Rep. AI Green DROPS BOMBSHELL In Fiery Speech
Oneindia News
1ヶ月前
Anthropicが報告|AIに「ズル」だけ教え...
AIヘッドライン
動画の報告
この動画が削除されている、または問題がある場合に報告してください。