⏱ 読了目安: 約7分
- 事実と背景:TypeSafe AIのJevを筆頭に、CloudflareのClefなど「生成しない」意思決定モデルが2026年秋に一挙台頭。
- 技術的変革:LoRAや専用ヘッド、エンコーダ型(Laya)の採用により、ミリ秒単位の超低遅延と出力トークン課金ゼロを実現。
- 現場への影響:従来のLLMによる構造化出力(JSONパース)から移行することで、APIコストを削減しシステムの信頼性を劇的に向上。
JSONパースの悪夢を終わらせるJevの衝撃
深夜2時、本番環境のアラートが鳴り響く。原因は、LLMが返したJSONの末尾に余計なカンマが1つ入っていたことによるパースエラーだ。我々エンジニアは、これまで「LLMに構造化出力をさせる」という不自然なアプローチに頼りすぎていた。zodやJSON Schemaでどれだけ縛ろうとも、確率的なテキスト生成モデルである以上、100%の信頼性は保証されない。しかも、ただ「AかBか」を判断させたいだけなのに、無駄な思考プロセス(Chain of Thought)や冗長なJSON文字列の生成に対して、高額な出力トークン課金を支払い続けている。この「デッドロック」とも言える不条理な状況に、決定的な終止符を打つ技術が現れた。それが、TypeSafe AIが2026年9月15日に発表した「System One Model」の先駆者「Jev」である。
Jevが提示したパラダイムシフトは極めてシンプルだ。「文章を生成せず、有限個の候補から選んで確率を返す」という一点に特化している。APIのインターフェース(POST /v1/systemone)を見れば、その合理性に目を見張るだろう。開発者は、判断の材料となる「state(状態)」、質問、そして選択肢(criteria)を渡すだけだ。Jevはテキストを1文字も生成することなく、各選択肢の確率(probabilities)と、その判断に対する確信度(confidence)を返す。
このアプローチの最大の恩恵は、出力トークン課金からの解放だ。Jevの料金体系は入力 $0.042/MTok(10億トークンあたり$42)のみで、出力は完全に無料である。さらに、従来の分類器のようにラベルを学習時に固定する必要がない。criteriaに「選択肢名から説明へのマップ」を動的に渡すことで、選択肢の追加や定義の修正が、APIリクエストの書き換えだけで完結する。これは、動的なルーティングや、ユーザーの入力に応じた動的なカテゴリ分類を行う現場において、文字通りのゲームチェンジャーとなる、と私は確信している。
群雄割拠する意思決定モデルのアーキテクチャ
Jevが切り開いたこの新領域に、巨大テックからインディーズ開発者までが雪崩を打って参入している。2026年10月現在、この「System One」市場は、その内部構造と実行形態によって大きく4つのアーキテクチャに分類できる。
第一の勢力は、JevやLiquid AIの「d1」、Upstageの「Solar Decide」に代表される「内部非公開のホスト型API」だ。特にSolar Decideは、コンテキストウィンドウが512Kと、Jevの64Kを遥かに陸駕しており、長大なドキュメント全体を「state」として流し込める強みを持つ。
第二の勢力は、Cloudflareが2026年10月1日に発表した「Clef」や、Jared Palmer氏の「Kev-27B」のような「27B級ベースモデル+LoRA/ヘッド」の構成だ。Clefは、Qwen3.8-27Bのベースモデルを凍結し、rank-256のLoRAとルーティングヘッドを同時に最適化している。特筆すべきは、Jevがテキストのみであるのに対し、Clefは画像(最大4枚)を状態として受け取れる点だ。CloudflareのWorkers AIで動作し、料金は$0.24/MTok。自社測定による遅延の中央値は209.3ms(Clef-flashは38.8ms)と、Jevの中央値524.1msを圧倒している。
第三の勢力は、より軽量な「0.8B〜9B級ベース+LoRA/ヘッド」だ。firelex氏の「Jeff」は、GemmaやQwenをベースに実効2Bクラスで動作し、RTX PRO 6000環境で22ms〜29msという驚異的な超低遅延を叩き出している。
そして第四の勢力として、Convaiの「Laya」に代表される「エンコーダ型」が存在する。LayaはModernBERT-large(395M)などをベースにし、非自己回帰の単一の順伝播で処理を行う。Cloudflareの測定では5.8msという極限の速さを記録しているが、品質(精度)とのトレードオフがあることも指摘されている。
ここで、主要な意思決定モデルのスペックと料金体系を整理した比較表を提示する。
| モデル名 | 提供元 | モデル公開 | 規模 / ベース | 入力上限 | 入力料金 (per MTok) | 特徴・画像対応 |
|---|---|---|---|---|---|---|
| Jev | TypeSafe AI | 非公開 | 非公開 | 64k | $0.042 | 元祖System One。テキストのみ。 |
| Clef | Cloudflare | 公開 (Apache 2.0) | 27B (Qwen3.8) | 64k | $0.24 | 画像可(最大4枚)。Jev互換API。 |
| Clef-flash | Cloudflare | 公開 (Apache 2.0) | 9B (Qwen3.5) | 64k | $0.09 | 超高速(中央値38.8ms)。画像可。 |
| d1 | Liquid AI | 非公開 | 非公開 | 未公開 | 無料(d1:free) | Jev互換。出力トークンは常に0。 |
| Solar Decide | Upstage | 非公開 | 非公開 | 512k | 未確認 | 超長大コンテキスト。ロジット読み。 |
| Jeff (firelex) | firelex | 公開 (Apache 2.0) | 0.8B〜2B (Qwen/Gemma) | ローカル依存 | 無料(自前実行) | 超低遅延(ローカルで20ms台)。 |
| Kev-27B | Jared Palmer | 公開 (Apache 2.0) | 27B (Qwen3.8) | ローカル依存 | 無料(自前実行) | フルファインチューン。pointer head採用。 |
| Laya | Convai | 公開 (Apache 2.0) | 322M〜421M (ModernBERT) | 512〜1,024 | 無料(自前実行) | エンコーダ型。非自己回帰で極限高速。 |
ロックインを回避するフォールバック設計
これほど多くのモデルが、Jevが定めた「POST /v1/systemone」という共通のインターフェース(スキーマ)に追従しているという事実は、我々アプリケーション開発者にとって極めて幸運なことだ。特定のプロバイダーにロックインされることなく、状況に応じてモデルを動的に切り替える「フォールバック・アーキテクチャ」を容易に構築できるからである。
私が提案したい実践的な処方箋は、確信度(confidence)をトリガーにした「多層防御(マルチステージ・ルーティング)」の設計だ。まず、最も安価で高速なローカルモデル(例:LayaやJeff)にリクエストを投げる。その返り値の確信度(confidence)が、あらかじめ設定した閾値(例:0.85)を超えていれば、その判断をそのまま採用してミリ秒単位で処理を終える。もし閾値を下回った場合は、より強力なホスト型モデル(JevやClef、あるいはGPT-6ベースと噂されるOpenAIのDecisions API)にフォールバックさせるのだ。この構成により、APIコストとレイテンシを最小限に抑えつつ、システムの堅牢性を極限まで高めることができる。
しかし、この技術の急速な普及は、我々に新たな問いを突きつけている。我々は「確率」というブラックボックスを、どこまで信頼してシステムの根幹に組み込んでよいのだろうか。従来のLLMであれば、Chain of Thought(思考プロセスの出力)を読めば、なぜその結論に至ったのかをデバッグすることができた。しかし、System Oneモデルはプロセスを一切出力しない。返ってくるのは、冷徹な「確率の数値」だけだ。
もし、自動運転や金融取引、あるいは医療のトリアージといったミッションクリティカルな現場で、0.01%の確率のブレが致命的な障害を引き起こしたとき、我々エンジニアは「モデルがそう判断したから」と言い訳するのだろうか。それとも、確率の裏にある「解釈可能性」を放棄した代償として、新たな技術的負債を背負い続けるのだろうか。明日からの開発で、あなたはこの「思考しない高速な脳」に、どのレベルの意思決定を委ねるだろうか。


コメント