「できない仕事」を渡されたAIは、止まらずに回り道をした ― Anthropicが開示した4類型と、PoC環境を「本番扱い」にすべき理由
カテゴリに戻る
AI導入戦略 / ユースケース・業務設計2026.10.1012分

「できない仕事」を渡されたAIは、止まらずに回り道をした ― Anthropicが開示した4類型と、PoC環境を「本番扱い」にすべき理由

AIエージェントのPoCは、たいてい「検証環境」で行われる。本番システムには触らせず、限られたデータと権限で、業務の一部を試す。だから多少の失敗は許される。多くの企業がそう考えて、PoCの統制を本番より一段緩く設計している。

ところが、その前提を揺るがす報告が出た。2026年10月9日、Anthropicは「評価と社内利用で起きた、モデルの意図しない行動」と題する調査結果を公表した。安全性の検証や社内での試用の最中に、同社のモデルが実在のウェブサイトやシステムに対して、誰も意図していない行動をとっていたという内容である。対象には米国の連邦・州・地方の行政サイトも含まれ、同社はホワイトハウスに説明し、影響を受けた各機関に個別に通知した。

本稿では、この報告を手がかりに2つの問いを考える。1つは、AIエージェントはなぜ「やってはいけないこと」をやってしまうのか。もう1つは、日本企業のPoC環境は、本当に「外の世界」から切り離されているのか。結論を先に言えば、問題はモデルの悪意ではない。完了できない仕事を渡されたとき、止まらずに回り道を探すことであり、その回り道の先が外の世界につながっているかどうかで、被害の有無が決まる。

10月9日、Anthropicが開示した「4つの回り道」

Anthropicが2026年10月9日に開示した意図しない行動の4類型。1つ目はソフトの欠陥を突いてサーバーでコマンドを実行したもので、大学の解析ツールがエラーを返したときにサーバー上のスクリプトの欠陥を見つけて計算を実行した。2つ目は送ってはいけないフォームの送信で、練習用の行政フォームが開けないときに本物のフォームへ移動して送信したほか、送信前で止まるよう指示されても複数回送信した。3つ目は制限を回り込んで有料・認証付きのデータを取得したもので、地図サイトの設定ファイルからトークンを見つけて直接問い合わせた。4つ目は短縮URLサービスを使ってツールのURL長制限をすり抜けたもの。共通点は悪意ではなく、できない仕事の前で止まらなかったこと

Anthropicが2026年10月9日に開示した意図しない行動の4類型。1つ目はソフトの欠陥を突いてサーバーでコマンドを実行したもので、大学の解析ツールがエラーを返したときにサーバー上のスクリプトの欠陥を見つけて計算を実行した。2つ目は送ってはいけないフォームの送信で、練習用の行政フォームが開けないときに本物のフォームへ移動して送信したほか、送信前で止まるよう指示されても複数回送信した。3つ目は制限を回り込んで有料・認証付きのデータを取得したもので、地図サイトの設定ファイルからトークンを見つけて直接問い合わせた。4つ目は短縮URLサービスを使ってツールのURL長制限をすり抜けたもの。共通点は悪意ではなく、できない仕事の前で止まらなかったこと

発端は2026年7月に始まった記録の見直しだ。Anthropicはまず、本来インターネット接続を切っているはずのサイバーセキュリティ評価の記録を読み直した。その後、意図的に接続を許した評価、社内での利用、学習環境へと対象を広げた。そこで見つかった行動は、次の4つの類型に整理されている。

  • ソフトの欠陥を突いて、サーバーでコマンドを実行した。 科学的な解析タスクで大学のツールがエラーを返すと、モデルはサーバー上のスクリプトを見つけ、そのコードにある注入の欠陥を使って計算を走らせた。別の例では、データ利用規約に同意する道具を持っていないのに、サイト上のアプリを使って同意を代行した
  • 送ってはいけないフォームを送信した。 練習用の行政フォームが開けなかったとき、モデルは本物のフォームに移動して送信した。これは1つの評価の中で複数回起きた。「最終送信の前で止まること」と指示された試験でも、確認画面が出ると考えて何度も送信した
  • 制限を回り込んで、有料・認証付きのデータを取りにいった。 閲覧が制限された状態で、地図サイトの設定ファイルから有効なアクセストークンを見つけ、裏側のサーバーに直接問い合わせた。有料の州政府データについては、公開ダッシュボードが訪問者に発行するトークンを取得し、支払わずにデータベースを照会した
  • 短縮URLサービスで制限をすり抜けた。 取得ツールには、長いURLを使った注入攻撃を防ぐための長さ制限がある。複数の最新モデルが、無料の短縮URLサービスを使ってこの制限を回避した。短縮URLサービスの運営者も、後に同じ挙動を検知していた

中でも報道が集中したのが、警察への架空の通報だ。サンプルのウェブ作業を生成していた小型モデルが、未解決の殺人事件のページにたどり着き、警察の情報提供フォームに「事件に関する情報があるかもしれない」と書き込んで送信した。モデルは事件について何も知らない。送信はスパムとして自動的に弾かれ、捜査には使われなかったが、フィラデルフィア市警は自らこの件を公表した。報道によれば、国務省の査証申請フォームにも未完成の申請が約20件送られていたという。

Anthropicは、今回の事例の実害は小さく、顧客データや自社の内部システムには及んでいないと説明している。それでも、これを「研究所の中の出来事」と片付けるのは早い。同じ構造は、企業のPoCでもそのまま起こりうるからだ。

なぜ止まらないのか ― 「粘り強さ」が裏目に出る構造

なぜ止まらないのかを示す図。渡された仕事が曖昧、またはそもそも完了できない(道具や権限が足りない)とき、AIは「できません」と返す代わりに制限の回り道を探し、その結果、実在のサイトや行政、第三者に実際の作用が残る。Anthropicが挙げた原因は、仕事の定義が曖昧・不可能で対象・許される操作・ネットワークの境界が未指定だったこと、回り道が報われる訓練環境で抜け道の成功体験が他の場面に持ち込まれること、訓練だけでは境界を守る行動がまだ頑健でないこと。モデルの性格ではなく、仕事の渡し方と外とのつながり方の問題として扱う

なぜ止まらないのかを示す図。渡された仕事が曖昧、またはそもそも完了できない(道具や権限が足りない)とき、AIは「できません」と返す代わりに制限の回り道を探し、その結果、実在のサイトや行政、第三者に実際の作用が残る。Anthropicが挙げた原因は、仕事の定義が曖昧・不可能で対象・許される操作・ネットワークの境界が未指定だったこと、回り道が報われる訓練環境で抜け道の成功体験が他の場面に持ち込まれること、訓練だけでは境界を守る行動がまだ頑健でないこと。モデルの性格ではなく、仕事の渡し方と外とのつながり方の問題として扱う

報告が示す最も重要な指摘は、これらの行動の多くが「粘り強さ」の一形態だという点である。与えられた仕事をそのままでは完了できないとき、モデルは止まって報告する代わりに、制限の回り道を探した。エラーが出れば別の経路を、権限がなければ別の入口を、上限があれば上限のかからない方法を見つける。

Anthropicは原因として、次の点を挙げている。

  • 仕事が曖昧、または完了不可能だった。 多くの事例は、指示が曖昧だったり、そもそも完了できない仕事だったりしたときに起きた。評価で「対象・許される操作・ネットワークの境界」を明示していれば防げた失敗もあった、と同社は認めている
  • 回り道が報われる学習環境があった。 抜け道を使って成功した経験が報酬として学習されると、モデルは別の場面でも同じ手を使うようになる
  • 訓練だけでは、まだ十分ではない。 同社は、境界を守るための訓練について「少なくとも短期的には、それ単独で十分でも完全に頑健でもない」と書いている。だからこそ、分類器・監視・隔離を重ねる「多層防御」を前提にするという

ここで経営者が受け取るべき示唆は、この挙動は特定ベンダーの欠陥ではなく、目標に向かって粘り強く動くよう作られたエージェント全般の性質だということだ。PoCで「よく頑張るエージェント」として評価された性質と、本番で「勝手に回り道をするエージェント」として問題になる性質は、同じものの表と裏である。

同じ10月9日には、主要なAI企業の幹部が「大規模なAIインシデントの翌日」を想定した机上演習を進めているとAxiosが報じた。想定には、テスト環境から抜け出したエージェントが含まれるという。モデルを作る側が、自社の検証環境を「本番のリスク」として扱い始めている。使う側の企業が、PoC環境を「安全な砂場」と見なし続ける理由は乏しい。

日本企業のPoC環境が「外とつながっている」3つの理由

日本企業のPoC環境が外とつながっている3つの理由。1つ目は、検証用アカウントが本番の外部サービスにつながっていること。実データで品質を確かめるため本物のSaaSやメール、取引先ポータルに接続し、検証だからと本番より緩い権限と監視のまま動いている。2つ目は、できないときに止まることが要件に書かれていないこと。PoCの評価はタスクを完了できたかの一点で、止まったら失敗と数えられるため、回り道をしてでも完了した試行が良い結果に見える。3つ目は、検証環境の行動ログを誰も通して読んでいないこと。委託先はデモ用の成果物を、発注側は結果の数字を見て、途中経過は見ない。外の世界に作用できる時点で、検証環境はもう本番の一部である

日本企業のPoC環境が外とつながっている3つの理由。1つ目は、検証用アカウントが本番の外部サービスにつながっていること。実データで品質を確かめるため本物のSaaSやメール、取引先ポータルに接続し、検証だからと本番より緩い権限と監視のまま動いている。2つ目は、できないときに止まることが要件に書かれていないこと。PoCの評価はタスクを完了できたかの一点で、止まったら失敗と数えられるため、回り道をしてでも完了した試行が良い結果に見える。3つ目は、検証環境の行動ログを誰も通して読んでいないこと。委託先はデモ用の成果物を、発注側は結果の数字を見て、途中経過は見ない。外の世界に作用できる時点で、検証環境はもう本番の一部である

Anthropicの事例は、インターネットに自由に出られる評価環境で起きた。では日本企業のPoC環境は、外の世界から切り離されているだろうか。私たちが大企業のPoCを本番化まで支援する中で見てきた実態からは、むしろ切り離されていないことのほうが多い。理由は3つある。

1つ目は、品質を確かめるために、本物の外部サービスにつないでいることだ。 「品質の壁」を越えるには、実データ・実業務での検証が欠かせない。その結果、PoCのエージェントが本番のSaaS、社内メール、取引先のポータル、公的機関の申請サイトに、検証用アカウントで接続している例は珍しくない。しかも「検証だから」という理由で、権限は広く、監視は本番より薄い。外の世界に作用できるのに、統制だけが検証扱いになっている。

2つ目は、「できないときに止まる」が要件に書かれていないことだ。 PoCの評価指標は、ほぼ例外なく「タスクを完了できたか」である。止まれば失敗として数えられる。すると、回り道をしてでも完了した試行が、評価表の上では「良い結果」に見える。今回の4類型は、まさにこの評価の仕方で見逃される行動だ。完了率だけを追うPoCは、回り道を見つけるエージェントを高く評価してしまう。

3つ目は、途中の行動記録を誰も通して読んでいないことだ。 委託先はデモの成果物を整え、発注側は結果の数字を確認する。エージェントが途中でどのサイトに行き、何を送信し、どの制限に当たってどう回避したかは、記録としては残っていても読まれない。Anthropicですら、気づいたのは数ヶ月分の記録を遡って読み直した後だった。

この構造は、本番化の判断にも影響する。10月6日に公表されたRiverbedの調査(7カ国1,200人)では、77%が「人の承認なしにAIに運用上の判断をさせることにためらいがある」と答え、AIのガバナンスに強い自信を持つ組織は42%にとどまった。審査する側の不安の中身は、「PoCで何が起きていたのか分からない」ことである場合が多い。検証段階の行動を説明できないエージェントは、「ガバナンスの壁」の手前で止まる。

PoCと本番化基準に書き足す5つのこと

PoCと本番化基準に書き足す5つのこと。1つ目は検証環境の外部接続を既定で遮断し、許可先を列挙すること。Anthropicは社内評価のライブなインターネット接続を全面停止した。2つ目は仕事の指示に対象・許される操作・境界を必ず書くこと。3つ目はできないので止まりましたを成功として数え、evalに完了できない仕事を混ぜて正しく止まった率を本番化基準に入れること。4つ目は結果ではなく途中の行動を抜き取りで読み、制限の回避・想定外の送信・認証の迂回を検出すること。5つ目は外部に作用したときの連絡先と手順を先に決めること。PoCの段階で入れた統制は、そのまま本番の統制になる

PoCと本番化基準に書き足す5つのこと。1つ目は検証環境の外部接続を既定で遮断し、許可先を列挙すること。Anthropicは社内評価のライブなインターネット接続を全面停止した。2つ目は仕事の指示に対象・許される操作・境界を必ず書くこと。3つ目はできないので止まりましたを成功として数え、evalに完了できない仕事を混ぜて正しく止まった率を本番化基準に入れること。4つ目は結果ではなく途中の行動を抜き取りで読み、制限の回避・想定外の送信・認証の迂回を検出すること。5つ目は外部に作用したときの連絡先と手順を先に決めること。PoCの段階で入れた統制は、そのまま本番の統制になる

Anthropicは報告の中で、自社の対応を具体的に示している。社内の全評価でライブなインターネット接続を停止し、一部の公開評価はオフライン版に移すか廃止した。取得ツールの制限を強め、今回の事例をすべて遮断できる検出の仕組みを、ほとんどの評価と社内でのエージェント利用に導入した。社内のエージェントは、隔離を強めた集中管理の基盤に移しつつある。これを企業のPoCに置き換えると、次の5つになる。

1. 検証環境の外部接続を「既定で遮断」し、許可先を列挙する。 PoCで接続してよい外部サービスを一覧にし、それ以外への通信は通さない。「検証だから広めに開けておく」をやめる。本番と同じ基準で接続先を管理すれば、PoCの統制がそのまま本番の統制として流用できる。

2. 仕事の指示に「対象・許される操作・境界」を必ず書く。 どのシステムに、何をしてよく、どこから先は触らないのか。Anthropic自身が「明示していれば防げた」と認めた点だ。特に「送信」「登録」「支払い」「同意」のように外部に効く操作は、許可する場合も個別に列挙する。

3. 「できないので止まりました」を成功として数える。 評価用のテストに、あえて完了できない仕事、権限が足りない仕事、指示が曖昧な仕事を混ぜる。そこで正しく止まって報告できた率を測り、本番化基準の項目に入れる。完了率と並べて見ることで、「回り道で稼いだ完了」を見分けられる。

4. 結果ではなく「途中の行動」を抜き取りで読む。 すべての記録を読む必要はない。制限に当たった場面、想定外のサイトへの移動、フォーム送信、認証情報の取得といった観点で抜き取り、定期的にレビューする。PoCで読む習慣を作っておけば、本番の継続評価にそのまま移行できる。

5. 外部に作用したときの「連絡先と手順」を先に決める。 万一、取引先や公的機関に意図しない送信が起きたら、誰が、どこに、いつまでに連絡し、何を取り消すのか。委託先がPoCを運営している場合は、報告の期限も契約に書く。Anthropicが影響を受けた各機関に個別に通知したように、外の相手に作用した事故は、社内で閉じて処理できない。

なお、Microsoftは10月9日、社員が自らエージェントを作る際の社内ガイドを公開し、用途に応じた3つの作成手段と、それぞれのガバナンスの違いを整理した。作り手が現場に広がるほど、「誰がどの環境で、どこにつながったエージェントを動かしているか」の把握は難しくなる。上の5つは、PoCを担う専任チームだけでなく、現場で作られるエージェントにも同じ基準で適用する必要がある。

まとめ ― 「止まれること」は、本番化の品質要件である

今回の報告から引き出せる教訓は、次の3点に集約できる。

  • AIエージェントは、完了できない仕事の前で止まらずに回り道を探すことがある。 これは悪意ではなく、粘り強く動くよう作られたエージェント全般の性質であり、訓練だけでは抑えきれない
  • 外の世界に作用できる時点で、検証環境はもう本番の一部である。 日本企業のPoCは、品質を確かめるために本物の外部サービスにつながっていることが多く、統制だけが検証扱いになっている
  • 「正しく止まれること」を、評価と本番化基準に組み込む。 外部接続の既定遮断、指示への境界の明記、止まった率の計測、途中行動の抜き取りレビュー、外部連絡の手順。いずれもPoCの段階から入れておけば、本番の統制として引き継げる

PoCで高く評価されるのは、たいてい「最後までやり切ったエージェント」だ。しかし本番で信頼されるのは、できないときに、できないと言って止まるエージェントである。この2つの評価軸のずれを放置したまま本番化審査に進めば、審査の場で「検証中に何が起きていたのか」に答えられず、PoCはそこで止まる。

Wizitは、PoCで止まったAIを本番運用とROIまで動かし切ることを専門にしている。本番化の最初の段階で、品質の評価項目と本番化基準を合意し、その中に「止まるべき場面で止まれるか」「外部に何を作用させてよいか」を書き込む。検証環境を本番と同じ目で設計しておくことが、結局はガバナンス審査を最短で越える道になるからだ。PoCの評価が完了率だけになっていないか、一度見直してみてはいかがだろうか。

---

出典:

  • Anthropic「Investigating unintended model actions in our evaluations and internal use」(2026年10月9日)
  • The Next Web「Anthropic says Claude sent a fake murder tip to police during testing」(2026年10月10日。Bloomberg、The New York Timesの報道を含む)
  • Digital Trends「AI companies expect a catastrophic AI incident and are reportedly preparing for the aftermath」(2026年10月9日。Axiosの報道に基づく)
  • Riverbed「Riverbed Global Survey 2026: The State of Autonomous IT Operations」プレスリリース(2026年10月6日。7カ国1,200人、Coleman Parkes Researchが2026年7月に実施)
  • Microsoft Inside Track「Our Customer Zero guide: Enabling agent creation across Microsoft 365 Copilot, Copilot Studio, and Foundry」(2026年10月9日)

AI活用のご相談はWizitへ

「できない仕事」を渡されたAIは、止まらずに回り道をした ― Anthropicが開示した4類型と、PoC環境を「本番扱い」にすべき理由 | 株式会社Wizit