AI

2026.09.23 20:44

AIが「できること」で人を採るな──スキルフロンティアの最前線

Adobe Stock

Adobe Stock

フロンティアAIモデルに、市場参入の意思決定を批評させたり、為替ショックの圧力に直面する多国籍企業のバリュエーションを説明させたり、難しい昇進判断を迫られた病院幹部に助言させたりすると、かなりの確率で回答の大半を正しく示す。ペンシルベニア大学、カーネギーメロン大学、ハーバード大学の研究者らが構築した新たなベンチマークは、18のビジネス分野にまたがる実際のMBAケーススタディ238件を用いたものだ。このベンチマークは、教員が自らの学生を採点する際に使うものと同じ評価基準に照らして採点され、今日の主要モデルが、ビジネススクールが1世紀をかけて教え、磨き上げてきた自由回答型の分析的推論において87%超のスコアを記録することを示した。

筆者は、このベンチマークの著者2人、ウォートン・スクールのカーティック・ホサナガー氏と、カーネギーメロン大学ハインツ・カレッジのラマイヤ・クリシュナン氏に、研究の意味合いと、こうしたベンチマークを開発することがなぜ重要なのかについて話を聞いた。

ホサナガー氏とクリシュナン氏によれば、組織内の多くのエントリーレベルのナレッジワーカーに割り当てられる仕事は、典型的には「市場参入計画を策定し、xx(期限)までに買収候補を挙げよ」といった類いのものだ。コンサルティング会社の若手戦略アナリストを想像すればよい。ナレッジワークは、明確な計算式や正解が規定されないまま、あいまいな言葉で定義される。既存のAIベンチマークは、ナレッジワークのこの側面をまったく検証していない。ホサナガー氏とクリシュナン氏は、医学分野における先例を強調した。大規模言語モデル(LLM)に符号化された医学用語や知識は、通常は多肢選択式の問題を含む米国医師国家試験(USMLE)でベンチマークするよりも、New England Journal of Medicine(NEJM)のケース課題で評価するほうが適しているというものだ。

ホサナガー氏、クリシュナン氏、カリソン=バーチ氏、ラカーニ氏による今回の研究は、こうしたアプローチをビジネススクールのケースに拡張したものだ。これにより、静的な理解ではなく、能動的で診断的な推論を必要とする現実世界のエントリーレベルのナレッジワーク環境でAIがどのように機能し得るかを評価する、より現実的なベンチマークが得られる。研究チームのアプローチでは、ライセンスを受けた238件のビジネスケースと、18分野にわたる615問を対象とし、それぞれを教員自身の模範解答に照らして採点した。架空企業と実在企業、数値データと非数値データ、主観的基準と客観的基準をシミュレートし、O*NETのスキルおよび職業の職業分類に対応づけた。また、このアプローチは5つの主要な事前学習コーパス(C4、Pile、RedPajama、Dolma、DCLM)にまたがる汚染に対して堅牢であり、ベンチマークデータがLLMの訓練に使われるテキストへ意図せず漏れ込んでいないことを確認している。

ビジネススキルとAI:ナレッジワークへの示唆

2年前であれば、同じベンチマークはAIモデルを苦戦させていただろう。あるモデルのスコアは2024年以降、23ポイント上昇した。これは、AIが明日にもストラテジストやCFOに取って代わるという意味ではない。ビジネス教育が常に最も重視してきたスキル、すなわち不確実性の下で、擁護可能で構造化された分析を生み出す力を、いまや機械が数秒で下書きできるということだ。未解決の問いは、それが人材育成のあり方に何をもたらし、残された思考の仕事を担う人材として誰が採用されるのかである。

ここにひねりがある。

ただし、その見出しとなる数字は、より興味深い物語を覆い隠している。研究者らは、より厳格な基準でも回答を採点した。評価基準の一部を満たした場合に部分点を与えるのではなく、モデルが教員の模範解答に含まれる期待要素を一つ残らず満たした場合にのみ満点としたのである。

ホサナガー氏とクリシュナン氏は、現実世界の問題解決における重要な側面として、完全な解を持つことは多くないと強調した。むしろ、コンサルティング会社の戦略アナリストが取り組んでいるのは、時間とリソースの制約の中で受け入れ可能な解を見つけることだ。彼らは、部分点による採点と満点(完全回答)による採点の違いを考慮することで、この意思決定の側面をベンチマークに組み込んだ。上位のAIモデルは、部分点を認める「標準」採点では87%超を記録し、最良のフロンティアモデルと最悪のフロンティアモデルの差は6.8ポイントだった。しかし、より厳格な「完全回答」採点(すべての評価項目を満たす必要がある)では、最良のモデルでさえ、完全に回答できた設問は半数に満たなかった。

この尺度では、最も成績の良いモデルでさえ、設問の半分未満しか完全に解答できなかった。「非常に有能な下書き」と「完全で、意思決定に使える回答」との間にある差こそが、フロンティアがなお存在する場所だとわかる。そしてそのフロンティアは均等に分布しているわけではない。評価では、モデルは財務計算のような構造化され、範囲の限定されたタスクではすでに優れた成果を上げている一方、自由回答型の助言的判断ではつまずいている。言い換えれば、「ここで実際に何をすべきか」という、公式では処理できない局面は、フロンティアモデルにとって難しい。この区別は、総合スコア以上に、採用やビジネス教育にとって重要である。

クリシュナン氏とホサナガー氏は、「AIは卓越した初稿を書くが、ゴールドスタンダードとなる最終稿にはまだ至っていない」と説明する。設問の種類よりも分野の違いのほうが重要だ。最も容易な分野と最も難しい分野の差(80.1%から95.0%)は、モデル間の差を上回る。自由回答型の助言業務(たとえば「事業機会を特定する」「財務事項について助言する」)が最も難しく、構造化された定量的タスクは上限に近い。すべてのフロンティアモデルを退ける設問は7%未満にすぎない。「3つのうち最良」を選ぶオラクルは92.6%に達し、研究者らは、異なるモデルが異なる点を見落とすことを発見した。

フロンティアが実際にどこにあるのかは、分野レベルのばらつきに表れている(ビジネスおよび政府関係は上限に近く、マーケティングとオペレーションは弱い)。O*NETの職業マッピングでは、機会の特定や利害関係者への助言といった「自由回答型の助言」業務が最も難しい活動である一方、構造化された分析はほぼ解決済みに近いことが示されている。

AI時代の「見習い」はどう変わるのか

ここで最も興味深いのは、変化の速度だけではない。2年間で23ポイントという世代的な飛躍が見られるだけでなく、その改善は広範囲に及んでいる(誰もが最初に改善すると予想していた「容易な」能力である数値推論に限られない)。ビジネス教育への示唆は明確だ。「分析を生み出せるか」から「その分析を監査し、ストレステストし、改善できるか」へと焦点が移っており、ケーススタディ方式の教育の将来に疑問を投げかけている。ホサナガー氏とクリシュナン氏は、この変化を、川上(上流)と川下(下流)の双方で必要とされるスキルの変化として説明する。「AIが生産のプロセス(問題の解き方)を変えているのであれば、解くべき問題が何であるかを、私たちはどう評価すればよいのか」

採用とエントリーレベルの役割への示唆も同様に興味深い。通常、若手アナリストの仕事は、判断力と推論力を育てる伝統的な訓練の場とみなされている。このベンチマークは、検証と監督のスキルをより早い段階で構築する、新たな見習いモデルの必要性を示している。

教育者にとって、このような研究は、希少なスキルが分析を生み出すことから、それを検証することへ移っている事実を示している。教育の負担は減るのではなく、むしろ増す。ホサナガー氏は、「他人のモデルを手に取り、それを評価できるようになるには、さまざまな種類のバリュエーションモデルを構築する経験を何年も積む必要があった」という逸話に触れた。組織にとって、これは、中間にある「下書き」がコモディティ化するにつれて、価値が上流(正しい問いを立てること)と下流(合意を形成し、意思決定の責任を負うこと)へ移行することを示す手がかりである。これにより、若手が歴史的に何年にもわたる実践を通じて判断力を培ってきた従来の訓練モデルに代わる「新たな見習い問題」への対応が必要になる。

かつては、初稿を何年も作成する中で身につけていたスキル、たとえば弱い前提を見抜く力や、提案が生煮えであることを察知する力は、いまや直接、しかもより早い段階で教えられなければならない。なぜなら、それらを教えていた制作の仕事そのものが急速に変化しているからだ。「見習い」の新バージョン、AI版が必要な時期なのだろうか。

forbes.com 原文

タグ:

advertisement

ForbesBrandVoice

人気記事