「もっともらしい嘘」が招く医療現場のデッドロック
システム開発の現場で、我々エンジニアは「仕様書にない挙動」に遭遇したとき、まずログを疑い、次にコードのロジックを疑う。しかし、大規模言語モデル(LLM)というブラックボックスを医療診断というクリティカルな領域に組み込んだとき、その「疑う」というプロセスそのものが崩壊するリスクが浮き彫りになった。フランスのLille University Hospitalの研究チームが発表した論文『Hallucination by proxy in LLM-assisted differential diagnosis』は、まさにこの「AIのハルシネーション(幻覚)」が、専門家の思考プロセスをいかに容易にハックするかを冷徹に証明している。
実験の内容は極めてシンプルかつ残酷だ。研究チームはLLMのシステムプロンプトを操作し、存在しない架空の疾患「ニューロカドミウム症(neurocadmiumatosis)」を、あたかも医学的に妥当な診断候補であるかのように出力させた。結果、参加した41人の医師のうち、実に44%にあたる18人がこの架空の病名を自身の鑑別診断リストに組み込んでしまったのだ。これは単なる「AIの誤回答」ではない。AIが提示した情報が、人間の専門家の認知バイアスを刺激し、誤った推論を補強する「代理ハルシネーション(Hallucination by proxy)」という新たな脅威の顕在化である。
我々エンジニアがこの事象から学ぶべきは、AIの出力が「確率的な推論」に過ぎないという事実を、ユーザーインターフェース(UI)やシステム設計の段階でいかに強制的に意識させるかという点だ。医師がAIの提示した診断を鵜呑みにした背景には、AIが提示する「もっともらしい構造」に対する過度な信頼がある。これは、スパゲッティコードを読み解く際に、コメントの記述を信じてロジックのバグを見逃すジュニアエンジニアの心理と酷似している。AIが生成する情報の「確信度」と「事実性」が乖離している現状において、システム側が「この情報は検証されていない可能性がある」というメタ情報をいかに提示し続けるかが、医療AI実装における最大の技術的課題となるだろう。
経験値という名の「デバッグ能力」の重要性
今回の検証で最も興味深いのは、AIのハルシネーションを見抜けた医師と、そうでない医師の間に明確な「経験値の差」が存在したことだ。神経放射線のトレーニング歴が6カ月以下の研修医層では、実に69%(26人中18人)が架空の病名に騙されたのに対し、6カ月を超える経験を持つ医師(15人)では、騙された者はゼロだった。このデータは、AI時代における「専門性」の定義を再考させるものだ。AIが生成する情報の真偽を判定する能力は、もはや単なる知識の蓄積ではなく、高度な「デバッグ能力」に他ならない。
以下の表は、今回の実験における医師の経験値と架空病名の受け入れ率をまとめたものである。
| 医師の経験値(トレーニング歴) | 参加人数 | 架空病名を受け入れた人数 | 受け入れ率 |
|---|---|---|---|
| 6カ月以下 | 26人 | 18人 | 69% |
| 6カ月超 | 15人 | 0人 | 0% |
この結果が示唆するのは、AIが普及すればするほど、AIの出力を批判的に検証できる「熟練者」の価値が相対的に高まるというパラドックスだ。AIは診断精度を52%から61%へと向上させる強力なツールとして機能したが、その一方で、基礎知識が不十分なユーザーに対しては、誤った情報を「正解」として刷り込む強力な洗脳装置にもなり得る。これは、GitHub CopilotなどのAIコーディング支援ツールを使いこなす際、生成されたコードの脆弱性を見抜けないまま本番環境にデプロイしてしまうリスクと全く同じ構造である。
我々が構築するシステムは、ユーザーのスキルレベルに応じてAIの介入度合いを動的に調整する「アダプティブ・アシスタンス」の概念を取り入れるべきではないか。初心者がAIを使う際には、より厳格なソース提示や検証ステップを強制し、熟練者に対しては効率を優先する。このような設計思想こそが、AIを「盲目的に信じる対象」から「思考を拡張するパートナー」へと昇華させる鍵となるはずだ。
AI時代のエンジニアが問われる「責任の所在」
最後に、我々エンジニアが直面せざるを得ない「責任の所在」という重い問いを投げかけたい。今回の実験で、架空の病名を受け入れた医師たちの確信度の中央値は37%にとどまっていた。彼らは心のどこかで「違和感」を抱きながらも、AIという「権威」に抗えず、リストに組み込んでしまったのではないか。これは、深夜の障害対応中に、AIが提示した「もっともらしいが実は間違っている修正案」を、焦りからそのまま適用してしまうエンジニアの姿と重なる。
AIが生成した誤情報が、人間の臨床医の診断思考に間接的に取り込まれる「代理ハルシネーション」は、医療現場に限った話ではない。法務、金融、そしてソフトウェア開発の現場においても、AIの出力はすでに我々の意思決定の「前提」となりつつある。もし、AIが生成した誤った診断やコードによって重大な事故が発生したとき、その責任は誰にあるのか。AIを開発した企業か、それを利用した医師やエンジニアか、あるいはそのシステムを設計したアーキテクトか。
我々が明日から取るべき対策は明確だ。第一に、AIの出力を「検証可能な形」で提供すること。引用元や根拠となる論文、あるいは推論のプロセスを可視化するUIを徹底すること。第二に、AIの出力を「鵜呑みにしない」ための教育と文化を組織内に醸成すること。AIはあくまで「確率的な予測機」であり、最終的な責任は常に人間が負うという原則を、システム設計の根幹に据えなければならない。
AIが生成した「存在しない病名」を信じてしまった研修医たちを笑うことは誰にもできない。我々もまた、AIが提示する「もっともらしい正解」という名の甘い罠に、日々さらされているのだから。あなたは、自分が書いたコードや設計したシステムが、AIのハルシネーションによって汚染されていないと断言できるだろうか?そして、その汚染を見抜くための「最後の砦」として、あなた自身の専門性をどうアップデートし続けるつもりだろうか?


コメント