日常的な使用において、AIシステムが時折事実を誤ることは以前からよく知られていたが、臨床やテクノロジーのリーダーたちの間で、新たな問題が懸念を強めている。それは、AIが完全に間違っており、その分野における実際の能力を全く備えていないにもかかわらず、説得力を持って有能であるかのように振る舞うことだ。業界の専門家はこの現象を「コグニティブ・スプーフィング(認知偽装)」と呼んでおり、これは、AIが意思決定(特に医療の提供に関わる事項)に必要な臨床的文脈や判断力を実際には欠いているにもかかわらず、自信ありげに専門知識を提示する能力を指す。AIは、洗練され、エビデンスに裏付けられているように見える回答を作成する能力を持っているため、これらのシステムに過度の信頼を寄せる臨床リーダーや医師は、日々の業務フローにおいて予期せぬトラブルに直面する可能性がある。
マイクロソフトによる研究では、最新のフロンティアモデルが医療用のベンチマークや試験で極めて高いスコアを記録できることが明らかになった。しかし、ストレステストを実施したところ、これらのシステムは実際の知識や適切な推論ではなく、巧妙な回答テクニックを利用していることが判明した。「主要なシステムは、画像などの重要な入力が削除された場合でも正しく推測することが多く、些細なプロンプトの変更で回答を翻し、説得力はあるものの欠陥のある推論をでっち上げる。これらは単なる一時的な不具合(グリッチ)ではない。今日のベンチマークが、医学的理解よりも『試験対策のテクニック』を評価してしまっている実態を露呈しているのだ」。これは、これらのシステムが客観的な試験で高スコアを獲得したとしても、実際の臨床現場やストレスのかかる状況に対応する準備が全く整っていない可能性があることを意味している。同研究が説明するように、AI評価のための臨床ベンチマークは、推論プロセスやその正解にどのように達したかよりも、正解率を重視することが多い。しかし、このアプローチがリアルタイムの現場でテストされた場合、重大な問題を引き起こす可能性がある。「医療現場における実用性(Medical readiness)は、多角的な概念だ。実際の現場において、モデルはデータの欠落やノイズに対処し、臨床医が理解できる方法で意思決定を正当化し、時間、モダリティ、文脈を超えて推論を行わなければならない。パフォーマンスは正確であるだけでなく、不確実性下においても信頼でき、解釈可能で、かつ安全でなければならないのだ」
そこに、より深刻な問題が潜んでいる。エンドユーザーや医師は、自分がいつ「スプーフィング(偽装)」されているのか、あるいは、回答が間違っているかもしれないのにAIに言いくるめられているのかを、どうすれば見極められるのだろうか。
その重要な答えの一つが「説明可能性(explainability)」という概念だ。これは、AIシステムがどのようにして出力に至ったかを正当化・明示させることを広く指す用語である。ユーザーが、モデルがどのような推論過程を経て最終回答に至ったかを正確に理解する助けとなるため、重要な意味を持つ。IBMが説明するように、「組織にとって、モデルモニタリングとAIの説明責任を通じてAIの意思決定プロセスを完全に理解し、盲目的に信頼しないことは極めて重要である……説明可能なAIは、エンドユーザーの信頼、モデルの監査可能性、AIの生産的な活用も促進する。さらに、実運用AIのコンプライアンス、法的、セキュリティ、評判上のリスクも低減する」
では、特に臨床現場において、ユーザーは何をすべきなのか。
システムを常に疑い、検証することだ。出力が提示されたら、AIがどのようにしてその結論に達したかを問い、その情報源を求め、システムに推論プロセスを透明に示すよう促す。その後、すべての情報源をダブルチェックし、実際にリンクをクリックして、出力内容が情報源と一致しているか確認する。確かに手間と時間はかかるが、特に臨床現場においては、エラーを未然に防ぐことができるのであれば、その追加の時間をかける価値は十分にある。



