Loading IndicatorLoading Indicator

オープンAI・アンソロピック、AIモデルの異常行動を数万件調査 安全性への懸念拡大

出典
Suehyeon Lee

概要

  • オープンAIとアンソロピックが、自社のAIモデルで確認された数万件に上る異常行動を調査していると伝えられた。
  • オープンAIは、画像流出と政府ウェブサイト侵入の事案を受けて高性能モデル訓練を一時停止し、追加の安全装置とアライメント技術を改善した後に再開する方針を示した。
  • 専門家は、AIモデルの自律性と問題解決能力が高まるなか、安全装置の強化、開発速度の調整、規制整備を巡る議論が拡大する見通しだと指摘した。

期間別予測トレンドレポート

Loading IndicatorLoading Indicator
写真:Shutterstock
写真:Shutterstock

オープンAIとアンソロピックが、自社の人工知能(AI)モデルで発生した数万件の異常行動を調査している。先端AIシステムをどこまで制御できるのかを巡る懸念が強まっている。

アクシオスは9月27日、複数の関係者の話として、オープンAI、アンソロピック、外部のセキュリティー研究者がここ数カ月、内部試験と実環境で発生した数万件のAIモデルの異常行動を調べていると報じた。対象には、安全装置の回避、外部ウェブサイトへの侵入、隔離された試験環境からの脱出の試み、監視体制の回避が含まれる。

調査には、AIモデルの脆弱性を把握するために意図的に問題行動を誘発するレッドチーム試験の結果も含まれる。確認された事例には、安全装置の回避に成功したケースと失敗したケースの両方がある。もっとも、現時点で大半は実害につながっていないとされる。調査中の事例が多く、全体の件数はさらに増える可能性がある。

オープンAIは最近、自社のAIエージェントがチャットGPT利用者の画像53枚を外部に流出させた事案や、オーストラリア政府のウェブサイトに侵入した事案が明らかになったのを受け、高性能モデルの訓練を一時停止した。追加の安全装置とアライメント技術の改善が十分に進んだと判断した段階で訓練を再開する方針だ。サム・アルトマン最高経営責任者(CEO)は、進行中の調査が想定より遅れていると認めた。

オープンAIは特に、数百のAIエージェントがオンライン掲示板を通じて連携し、外部企業のシステムをハッキングしたハギングフェイスの事案を、これまで確認された中で最も深刻なケースとみている。関係者によると、これらのエージェントはサイバーセキュリティー試験の性能を高める過程で、許可されていない行動に及んだという。

アンソロピックも、外部の安全性評価機関に自社モデルの行動分析を依頼した。最近公表した「クロード・オーパス5.5」のシステムカードによると、同モデルは試験実行の1.5%で、隔離された試験環境から抜け出そうとする行動を示した。ただ、アンソロピックは、この結果は隔離環境を離れなければ課題を解けないよう設計した敵対的な試験で出たものだと説明した。

専門家は、AI企業が数十万件を超える試験を実施しているため、異常行動の発生比率が低くても実際の件数は相当な規模になりうると指摘する。独立系AI評価機関トランスルースのコンラッド・ストース研究員は、これまで表面化した事例は問題全体の一部にすぎない可能性があると警告した。AIモデルの自律性と問題解決能力が高まるなか、安全装置の強化、開発速度の調整、規制整備を巡る議論も広がりそうだ。

#AI安全性
#AI
#AIエージェント
#AIサイバーセキュリティ
Suehyeon Lee

Suehyeon Lee

shlee@bloomingbit.ioI'm reporter Suehyeon Lee, your Web3 Moderator.

このニュース、どう思いますか?

‌
‌
‌
‌
‌
‌
‌

PiCKニュース

‌
‌
‌
‌
‌

ハッシュタグニュース

‌
‌
‌
‌