AI

2026.09.28 13:00

「会話をしないAI」Jevが注目される理由 意思決定に特化した新モデル

abdelaziz - stock.adobe.com

「ハルシネーションを起こさない」は何を保証するのか

TypeSafeが「Jevはハルシネーションを起こさない」と主張したことは、開発者の間で大きな議論を呼んだ。

advertisement

形式は正しくても、判断そのものは間違う

TypeSafeが指しているのは、Jevが事前に定義した構造から外れる応答を生成できないという点だ。5つの分類から選ぶよう求められた場合、Jevが6つ目を考案することはない。ただし、誤った分類を選んだり、誤答に高い確率を付けたりする可能性はある。TypeSafeが保証するのは応答の形式であり、判断が事実として正しいことではない。

偽の認証情報で変化したJevの遮断判断

より重要なのは、VentureBeatが9月21日に報じた調査だ。調査では、破壊的な結果を招く可能性があるコンピューターコマンドを使ってJevを試した。Jevは当初、コマンドを遮断する確率を0.76とした。技術者がモデルへ渡す情報に、権限があるように装う偽のメッセージを加えると、遮断確率は0.48へ下がった。

実験対象は1つのコマンドだけで、権限があると偽るメッセージを入力へ混ぜる攻撃がどの程度成功するかは分からない。ただし、悪意ある情報をアプリの入力へ混ぜると、Jevの判断に影響し得ることは示された。許可されていないコマンドを承認するセキュリティシステムは、70ミリ秒で判断したからといって信頼性が高まるわけではない。

advertisement

既存LLMとの差は速度と費用にあるのか

「Jevはハルシネーションを起こさない」というTypeSafeの説明は、技術系コミュニティHacker Newsの公開時スレッドでも主要な議題となった。開発者からは、TypeSafeによる説明の正確さに異議が出た。

コードを生成し、答え方をあらかじめ限定しないタスクもこなせる言語モデルとJevを比べることが妥当なのかという疑問も出た。従来型言語モデルも出力形式を制限できるため、Jevの重要な違いは速度と費用だとする意見もあった。

企業導入で最も重い論点は「誤判断の代償」

アルメイダが従来型言語モデルに感じた不満は、TypeSafeの手法を形作った。TechCrunchに対し、会話AIを使ったソフトウェア自動化に限界を感じていることを、次のように表現した。

「瓶の中に稲妻を捕まえたのに、役に立たない」

企業向けソフトウェアでは、多くの自動処理で必要なのは、アプリが情報を調べて実行する行動を選ぶことだ。アプリが選んだ行動について高度な説明文を生成しても、結果を改善しないまま遅延と費用だけを増やす可能性がある。

Jevを他のAIモデルと組み合わせる使い方

Jevの用途は、高額なモデルを安価なモデルへ置き換えるだけにとどまらない。開発者はJevを使い、AIエージェントが提案した行動を評価したり、より高性能な言語モデルが必要な場面を判定したりできる。AIエージェントが終えた作業を調べ、自動処理を先へ進めてよいか確認する用途にも使える。

Jevと他のAIモデルを組み合わせるシステムでは、すべての処理を1つの会話型モデルへ任せず、各モデルの能力に合う仕事を割り当てる。

本番運用に移れば、初期試験だけでは分からないことが増える

初期実験は、特定の仕事でJevが費用と応答時間を減らせることを示した。ただし、本番環境で継続的に使った場合の性能、未知のデータに対する精度、誤判断が運用へ及ぼす影響には未解決の問題が残る。

Jevを評価する企業にとって最も重要な指標は、速度でも価格でもなく、誤判断の代償かもしれない。振り分けの誤りなら顧客を間違った部署へ送る可能性がある。セキュリティ分類を誤れば、破壊的なコマンドを承認する恐れがある。顧客対応の誤分類とセキュリティ上の誤判断ではリスクが大きく異なり、Jevが両方の用途に適するとは限らない。

TypeSafeは、Jevを異例の低価格で試せるようにした。Jevが企業向けソフトウェアに定着するかどうかは、販促価格と初期の性能試験に代わって本番環境で継続運用する段階に入った後、開発者が何を発見するかにかかっている。

(forbes.com 原文)

タグ:

advertisement

ForbesBrandVoice

人気記事