低価格・高速という強みと、精度のトレードオフ
TypeSafeはJevという名称を、19世紀の経済学者ウィリアム・スタンレー・ジェヴォンズにちなんで付けた。ジェヴォンズは、資源利用の効率が改善すると消費量が増える可能性を研究した。
TypeSafeは、効率向上が利用拡大を促すという効果がAIでも起きるとみている。推論費用が下がれば、現在は固定的なルールや人手に頼っているソフトウェア処理へ、AIによる判断を組み込むことが経済的に可能になるという考えだ。
入力10億トークン42ドル、競合モデルとは大きな価格差
TypeSafeによると、Jevの応答時間は70~500ミリ秒で、料金は入力100万トークン当たり0.042ドル(約7円)、出力トークンは無料だ。入力100万トークン当たり0.042ドルという料金を基にすると、他のインフラ費用や運営費を除き、入力10億トークンを42ドル(約6633円)で処理できる。
同じ10億トークンを入力した場合、アンソロピックのClaude Opus 5.5またはOpenAIのGPT-5.6 Solなら約4000ドル(約63万円)だ。Claude Opus 5なら約5000ドル(約79万円)、Claude Fable 5.1またはGPT-6 Astraなら約1万ドル(約158万円)になる。いずれも追加料金が発生する出力トークンは含まない。
TypeSafeは社内の業務評価で、比較対象に選んだ最先端の言語モデルよりJevが約194倍速く、費用は約445分の1だったと主張する。TypeSafeは、約194倍と約445分の1という数値が、顧客に見込まれる改善幅の上限に近いことも認めている。
安ければ十分なのか、独立試験では精度に差
高速で低価格でも、必ずしも正確とは限らない。TypeSafeが公開した結果にも、精度とのトレードオフが表れている。Explainx.aiの独立試験では、Jevの総合精度は67.8%で、TypeSafeの評価で最も高い精度を示した比較対象は74.1%だった。
価格差だけでなく、精度差にも注意が必要だ。優先度の低い顧客メッセージを分類するアプリなら、時折の誤分類を許容できるかもしれない。金融取引や破壊的なソフトウェアコマンドを承認するシステムでは、誤りを受け入れる余地がはるかに小さい。
開発者はJevをコマンド判定やAIエージェント評価に使い始めた
JevはAIエージェント向けの基盤を作る企業からも関心を集めた。Vercelのエンジニア、シャルマは、コマンドを安全に実行できるか分類する言語モデルの代わりにJevを試した。TechCrunchによると、応答速度は5~18倍になり、シャルマの試験では精度も上がった。
VercelとBryo AIの試験で何が分かったのか
TechCrunchの報道によると、技術営業向けAIソフトウェアを開発するBryo AIで最高技術責任者(CTO)を務めるニキル・ムドホルカルは、業務メールを分類する試験でJevを試した。Geminiの精度がわずかに高かったが、費用はJevの約10~20倍だった。
VercelとBryo AIの試験は、費用と精度のトレードオフを具体的に示す。特化モデルは大幅に低い費用で十分な精度を出せる場合がある。ただし、採用できるかどうかは、誤判断した時に何が起きるかで決まる。
LangChainが試した「AIを評価するAI」
AIアプリ開発フレームワークLangChain(ラングチェーン)は、別のAIエージェントがどう動いたかを評価する用途でもJevを試した。開発者は一般に、言語モデルにエージェントの実行結果を調べさせ、仕事を正しく終えたか判断させる。アプリが毎日数千回動く場合、AIエージェントを評価する処理には多額の費用がかかる。
LangChainは9月20日の実験で、気象情報を扱うAIエージェントの記録済み応答5件を使い、Jevと従来型言語モデル3製品を比較した。各評価モデルに同じ応答を繰り返し判定させ、精度、一貫性、速度、費用を比べた。
Jevは500回の2択判断すべてで、人間の評価者と一致した。1回の評価は平均0.44秒、0.00035ドル(約0.06円)だった。連続値で付けた品質スコアのばらつきも、LangChainの試験では競合モデルより大幅に小さかった。ただし、実験対象は1つのエージェントと限られた仕事だけである。一貫した判断が正しい判断とは限らない。


