2026 年 9 月 15 日、米国の TypeSafe AI という会社が「Jev(ジェヴ)」という AI モデルを発表しました。トップページには「193.6 倍速く、444.6 倍安い」と大きく書かれています。ChatGPT の土台になった研究に関わった元 OpenAI の研究者ディオゴ・アルメイダ氏らが創業した会社で、発表と同時に 4,000 万ドルの資金調達も明らかにしました。
数字だけを見ると、今使っている ChatGPT や Claude が要らなくなるように見えます。業務に AI を組み込んでいる会社にとっては、費用が 2 桁下がるなら切り替えたい話です。一方で、何と比べて 193.6 倍なのか、何ができて何ができないのかは、見出しの数字からは分かりません。
この記事では、TypeSafe AI の公式サイト、開発者向けドキュメント、同社が公開している評価サイトを読み、Jev が LLM(大規模言語モデル。ChatGPT や Claude の中身)の代わりになるのか、会社の業務のどの判断に使えるのかを整理します。
Jev は LLM の代わりにはなりません。文章を書かず、あらかじめ決めた選択肢の中から答えを選び、その確率を返すだけのモデルです。そのかわり、問い合わせの振り分けや審査の一次判定のような「決まった形の判断」を、1 回 1 秒未満で、精度が同じくらいの LLM の約 8〜76 分の 1 の費用で返します。ただし精度は最上位の LLM より下がります。同社自身の評価サイトでは、4 つの業務の平均で Jev の一致率は 67.8% です。OpenAI の中位モデル(評価サイトでの表記は terra)とほぼ同じで、上位モデルの 73〜74% には届きません。「193.6 倍」は同社が作った業務で測った値で、同社自身が現実の上限寄りだと書いています。日本語は扱えるものの英語ほどの精度は出ないと公式に明記されており、現時点では限られた開発者向けの早期提供です。品質を保つために業務フローへ AI を組み込んでいるはてなベースは、形の決まった判断を担う部品として Jev を勧めます。日本語での一致率の検証と、止まったときの逃げ道の用意が前提です。
この記事の要約
この記事の調べ方
製品の仕様、価格、苦手なことは TypeSafe AI の公式サイトと開発者向けドキュメントを、精度と費用の数字は同社の評価サイトを、2026 年 9 月 23 日に開いて確認しました。資金調達の内容は同社が Business Wire で配信したプレスリリースによります。Jev は申し込み制の早期提供のため、はてなベースではまだ実際に動かしていません。第三者の評価は、出典を示したうえで補足にとどめています。
Jev は文章を書かない。答えの形が決まった「判断専用」のモデル
Jev がこれまでの AI と一番違うのは、文章を返さないことです。ChatGPT や Claude に質問すると、答えは文章で返ってきます。Jev に渡すのは、判断の材料になる文章やデータと、あらかじめ形を決めた質問だけです。返ってくるのは、選んだ答えとその確率だけです。
質問の形は 3 種類しかありません。公式ドキュメントの仕様を整理すると次のとおりです。
| 質問の形 | 返ってくるもの | 業務での例 |
|---|---|---|
| はい・いいえ | 「はい」である確率(0〜1) | この問い合わせは急ぎか |
| 選択肢から 1 つ選ぶ | 選んだ選択肢と、すべての選択肢の確率、。選択肢は最大 255 個。 | どの部署が担当すべきか |
| 段階で評価する | 2〜10 段階のどこに当たるかと、確信度 | お客さまの苛立ちは 3 段階のどれか |
公式の入門ページには、問い合わせメールを振り分ける例が載っています。「Stripe との連携が 3 日間失敗し続けていて売上を失っている、至急助けてほしい」という英文を渡し、担当部署・苛立ちの度合い・急ぎかどうかの 3 つを同時に聞くと、次の答えが返ってきます。
| 聞いたこと | Jev の答え |
|---|---|
| 担当部署(請求・技術・営業から選ぶ) | 技術。確率は技術 85%、請求 15%、営業 0%。 |
| 苛立ちの度合い(落ち着いている・苛立っているが丁寧・強い言葉で怒っている) | 苛立っているが丁寧 |
| 急ぎの内容か | 「はい」の確率 100% |
答えがこの形で返ってくるので、受け取った側のシステムは文章を読み解く必要がありません。「技術の確率が 80% 以上なら技術チームに回す、それ未満なら人が見る」のような分岐を、そのまま書けます。LLM に同じことをさせると、返ってきた文章から答えを取り出す処理と、形が崩れていたときのやり直しが要ります。
TypeSafe AI はこの種類のモデルを「System One モデル」と呼んでいます。人の思考を、直感で素早く判断する System 1 と、じっくり考える System 2 に分けた考え方から取った名前です。CEO のディオゴ・アルメイダ氏は発表ブログで、Jev を「最先端の知能を持った関数呼び出し」だと説明しています。
Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.(Jev は最先端の知能を持った関数呼び出しだと考えてほしい。形の決まっていない情報を入れると、形の決まった確率つきの判断が出てくる)
TypeSafe AI 公式ブログ「Introducing System One Models & Jev」(2026 年 9 月 15 日、筆者訳)
速さと安さは桁が違う。入力は 100 万トークン 0.042 ドル、出力は無料
価格は、読み込ませた量だけで決まります。公式ドキュメントでは、入力 100 万あたり 0.042 ドルで、出力は無料です。
| モデル | 入力(100 万トークンあたり) | 出力(100 万トークンあたり) |
|---|---|---|
| Jev | 0.042 ドル | 無料 |
| GPT-5.6 Terra(OpenAI) | 2 ドル | 12 ドル |
| Claude Opus 5.5(Anthropic) | 4 ドル | 20 ドル |
入力の単価だけで比べても、Jev は GPT-5.6 Terra の約 48 分の 1、Claude Opus 5.5 の約 95 分の 1 です(筆者計算)。LLM は出力にも料金がかかり、しかも答えの前に考える分のトークンも出力として数えられるので、実際の差はさらに開きます。公式の入門例の問い合わせ 1 通は 392 トークンで、費用は約 0.0000165 ドルでした。月に 1 万通振り分けても 1 ドルに届きません(筆者計算)。GPT-5.6 Terra と Claude Opus 5.5 の単価は各社の公式価格ページによります。Opus 5.5 の料金はOpus 5.5 の解説記事にまとめています。
速さについて、公式ブログは「最先端の LLM の応答が 3〜329 秒かかるのに対し、Jev は 70 ミリ秒〜500 ミリ秒」と書いています。人が画面で待つなら LLM でも困りませんが、システムの中で何千件も続けて判断させる場面では、この差がそのまま処理時間の差になります。
注意したいのは、利用量の上限が固まっていないことです。公式ドキュメントでは毎秒 25 万トークン、毎分 1,200 回までとされていますが、「需要が非常に大きいため、予告なく変わることがある」と書かれています。価格についても、同社は「持ち出しで安くしているのではないことは、まだ証明できない。長い目で見て示すしかない(値上げではなく値下げを見込んでいる)」と、ブログで率直に書いています。
「193.6 倍速い・444.6 倍安い」は、同社が作った業務で測った上限寄りの数字
トップページの「193.6 倍速い、444.6 倍安い」には、小さく「System One 型の業務フローで測った値」という注記が付いています。発表ブログと評価サイトを読むと、どう測ったかが分かります。
- 測った業務は、セキュリティ事案の判定、AI エージェントの記録の監視、請求書の処理、カスタマーサービスの 4 つ。どれも TypeSafe AI のチームが作った業務フロー。
- 正解として使ったのは人の判断ではなく、OpenAI の GPT-6 Astra と Anthropic の Claude Fable 5.1 に深く考えさせた答えの平均
- 比べた LLM は各社の既定の設定で動かし、同社が用意した仕組みを通して呼んでいる。ブログは、この方法だと LLM 側が遅く高くなりやすいと自ら注記している。
- 速さは米国西海岸のノート PC から測っている。日本から使えば、通信の分だけ遅くなる。
そのうえで、ブログは次のように書いています。
This is where the claims of 193.6x faster, 444.6x cheaper on our home page comes from, and we expect that these are on the higher end of real world gains.(トップページの「193.6 倍速い、444.6 倍安い」はここから来ている。実際の業務で得られる効果としては、上限寄りの数字だと考えている)
TypeSafe AI 公式ブログ(2026 年 9 月 15 日、筆者訳)
同じ会社の発表でも、場所によって数字が違います。ブログは「40〜200 倍速い」、Business Wire で配信したプレスリリースは「応答は 100 ミリ秒未満、ほかの最先端モデルより最大 100 倍速く安い」です。193.6 倍と 444.6 倍を、公開されている評価の表から計算し直すことはできませんでした。どのモデルと比べた倍率なのかも、公開ページからは特定できません。
速さや安さの倍率を第三者が測り直した結果は、この記事を書いた時点で公式には示されていません。倍率は「同社の条件での最大値」として受け取り、自社の業務でどれだけ縮むかを確かめるのが現実的です。
同社の評価サイトで見ると、精度と費用の交換条件がはっきりする
倍率より判断に役立つのが、同社が公開している評価サイトです。同じ 4 つの業務で、Jev と各社の LLM の一致率(正解と同じ答えを返した割合)、1 件あたりの費用、1 件あたりの時間が並んでいます。LLM には測り方が 2 通りあり、ここでは成績のよい「業務フロー方式」の値を 4 業務の平均で載せます。
| モデル | 一致率(%) | 1 件あたりの費用 | 1 件あたりの時間 |
|---|---|---|---|
| Jev | 67.8 | 0.0004 ドル | 0.4 秒 |
| terra(OpenAI) | 67.9 | 0.0304 ドル | 10.1 秒 |
| sol(OpenAI) | 74.1 | 0.0836 ドル | 23.3 秒 |
| luna(OpenAI) | 66.8 | 0.0033 ドル | 12.9 秒 |
| Claude Opus 5 | 73.1 | 0.1761 ドル | 37.8 秒 |
| Claude Sonnet 5 | 67.8 | 0.1174 ドル | 78.1 秒 |
| Claude Haiku 4.5 | 53.6 | 0.0195 ドル | 12.5 秒 |
Jev の一致率は terra とほぼ同じで、費用は約 76 分の 1、時間は約 25 分の 1 です(筆者計算)。一方で、一番よい sol や Claude Opus 5 とは 5〜6 ポイントの差があります。つまり Jev は「最上位と同じ精度を安く出す」モデルではなく、「中位の LLM と同じくらいの精度を、桁違いに安く速く出す」モデルです。評価サイトは OpenAI のモデルを terra・sol・luna の略称だけで載せており、世代は書かれていません。

業務ごとに見ると、差の出方が違います。カスタマーサービスでは Jev が 76.0% で、sol の 78.3% に近く、terra の 72.7% や Opus 5 の 72.4% を上回りました。一方で請求書の処理では Jev が 61.8% にとどまり、sol の 79.1%、Opus 5 の 78.4%、terra の 74.7% と 13〜17 ポイントの差が開いています。
| 業務(一致率 %) | Jev | terra | sol | Claude Opus 5 |
|---|---|---|---|---|
| カスタマーサービス | 76.0 | 72.7 | 78.3 | 72.4 |
| 請求書の処理 | 61.8 | 74.7 | 79.1 | 78.4 |
請求書の処理で差が開くのは、次に書く Jev の苦手分野と重なるからだと考えられます。金額の計算や期日の比較が絡む判断は、Jev の弱いところです。自社で使うなら、平均の一致率ではなく、自分の業務に近い種類の成績を見る必要があります。
「ハルシネーションしない」は答えの形の話で、正しさの保証ではない
発表ブログは、Jev は「ハルシネーション(もっともらしい誤り)を起こさない」と書いています。これは誤解されやすい表現です。同じブログの注記には、こう書かれています。
Our number is not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots.(この数字は実測ではない。答えが決めた形に必ず合うことは保証されているので、図に 0% と書き入れている)
TypeSafe AI 公式ブログ(2026 年 9 月 15 日、筆者訳)
保証されているのは、用意した選択肢以外の答えが返ってこないことと、答えの形が崩れないことです。選んだ答えが正しいかどうかは別の話で、それが上の一致率の数字です。3 割前後は正解と違う答えを返していることになります。
公式ドキュメントには、Jev 1.13 が苦手なことの一覧も載っています。同社が自分から弱点を公開している点は評価できます。
| 苦手なこと | 業務で起きそうなこと |
|---|---|
| 文字どおりに読みすぎること | 言外の意図や業界の慣習を汲まずに判断する |
| 計算、数値の扱い、件数を数えること(「Jev は計算機ではない」と明記) | 請求額が上限を超えているか、明細が何件あるかを判断させると外れる |
| 日付や時刻の比較 | 支払期日を過ぎているかの判定を任せられない |
| 間接的な言い回し、二重否定 | 「〜でないとは言えない」のような文で判断がぶれる |
| 判断に関係ない情報が大量に混じった入力 | 長い契約書を丸ごと渡すと精度が落ちる |
| 悪意のある入力 | 問い合わせ文に仕込まれた指示に引きずられる |
| 質問文と選択肢の説明が矛盾していること | 設計の甘さがそのまま誤判定になる |
| 答えどうしの論理的な整合 | 「返金か」と「返金ではないか」の確率を足すと 1 を超えることがある |
| 文章を書くこと | 返信文や要約は作れない |
このほか、渡せるのは文章だけで、画像・音声・PDF はそのまま読めません。1 回に渡せる量は 6 万 4 千トークンまでで、判断の材料と一番長い質問の合計は 3 万 2 千トークンまでです。判断の理由も返ってこないため、なぜその答えになったかは説明できません。
この点については第三者からも指摘があります。開発者のサイモン・ウィリソン氏は、試したうえで「理由が示されないブラックボックスに戻ってしまう」と書き、偏りのある判断が気づかれにくいことを懸念しています。例として、サンフランシスコ湾岸地域の都市を「良い都市か」で採点させたところクパチーノが最上位、イーストパロアルトが最下位になった結果を挙げ、採用候補者の順位づけのような用途には使ってほしくないと述べています。
日本の会社が今すぐ使うには、言語と契約の壁がある
仕組みとしては魅力がありますが、日本の会社がすぐ業務に入れるには、確かめるべきことが残っています。
| 項目 | 公式に書かれていること |
|---|---|
| 提供の形 | 申し込み制の早期提供。「一部の開発者」に順次開放しており、選考の基準は公開されていない。 |
| 日本語 | 学習の中心は英語で、精度が一番出るのも英語。日本語を含む他の言語も扱えるが同じ水準ではなく、自社のデータで試してから使うよう求めている。 |
| 契約と地域 | サービスは米国でホストされている。API の契約書に地域の限定はなく、輸出規制の対象国を除くだけ。ただしサイトの利用規約には「米国内の訪問者向け」という一文があり、日本からの申し込みが通るかは公開情報では分からない。 |
| 入力データの扱い | プライバシーポリシーは、入力を AI の学習や調整に使わないと明記。契約書は「事前の同意なしには学習に使わない」という書き方。大企業向けにデータを保存しない契約もある。 |
| 稼働の保証 | 標準の契約書には稼働率の保証(SLA)がなく、「ドキュメントどおりに概ね動く」ことだけを保証。利用量の上限も予告なく変わりうる。 |
| 禁止事項 | Jev をもとにした蒸留、Jev の出力をまねるモデルの学習、競合製品の開発は禁止。一方で、Jev が返す確率を使って自社の従来型の分類器を学習させる方法は、公式ドキュメントが勧めている。 |
日本語の精度の数字は、公式には出ていません。日本の会社が一番気にする部分なので、国内で使う場合は自社の日本語データで一致率を測ることが前提になります。もうひとつ、業務の止まり方も考えておく必要があります。稼働の保証がなく上限も動くので、Jev が止まったときに従来のルールや人の確認に戻せる作りにしておかないと、業務ごと止まります。
使えそうな判断、任せてはいけない判断
公式ドキュメントが挙げる用途は、振り分け、採点、抽出、審査の一次判定、LLM の答えの検査などです。同社は発表ブログで、これを「業務フローの中の賢い if 文」と表現しています。日本の中小企業でよくある業務に当てはめると、公式の情報から次のように整理できます。
| 業務 | 向いている部分 | 任せてはいけない部分 |
|---|---|---|
| 問い合わせの振り分け | 担当部署・緊急度・苛立ちの判定。公式の入門例そのもので、評価サイトのカスタマーサービスでも上位の LLM に近い精度が出ている。 | 返信文の作成(文章は書けない)。日本語での精度は自社データで要確認。 |
| 請求書の仕訳 | 勘定科目を選択肢として渡せば、定義外の科目が返ってこない | 金額・税額・期日の判断(計算と日付の比較が苦手)。評価サイトの請求書処理でも上位 LLM より 13〜17 ポイント低い。PDF は文字にしてから渡す必要がある。 |
| 与信・審査の一次判定 | 申込書の文章から気になる点を拾い、確信度が低いものを人の審査に回す | 財務数値の比較(計算はプログラムで行う)。判断理由が返らないので、断る理由の説明には使えない。 |
| 在庫・発注 | 商談メモや問い合わせから需要の兆しを拾う補助 | 発注量を直接決めさせること。数量の計算と在庫の比較は苦手。 |
どの業務にも共通するのは、Jev に「全部を任せる」のではなく、「確信度の高いものだけを自動で処理し、低いものを人か上位の LLM に回す」使い方です。公式ドキュメントも、確信度を見て振り分ける設計を勧めています。1 件あたりの費用が、精度が同じくらいの LLM より 1 桁前後安いので、まず Jev に全件を通し、迷ったものだけ高い LLM に回しても、全体の費用は下がる計算になります。AI の費用の見積もり方は本番 AI の月額費用を見積もる記事で詳しく書いています。
はてなベースは、業務フローの判断を担う部品として Jev を勧めます
Jev は、ChatGPT や Claude を置き換えるものではありません。文章を書く、調べる、考えを組み立てるといった仕事は、これからも LLM の役割です。Jev が変えそうなのは、LLM が得意すぎて費用が見合わなかった「単純だが量の多い判断」です。1 件数円かかっていたから人手のままにしていた振り分けや一次判定が、平均で 1 件 0.06 円ほど(1 ドル 150 円で計算)で回せるようになります。
はてなベースでは、品質を保つための手段として、システムの業務フローに AI を組み込むことを常に進めています。人の目だけに頼ると、件数が増えたときに見落としや担当者ごとの判断のばらつきが出ます。そこで、フローの途中に AI の判断を一段挟み、決まった基準で全件を確かめる作りにしています。その立場から、形の決まった判断を担う部品として Jev を勧めます。
勧める理由は 3 つあります。1 つ目は、答えが必ず用意した選択肢の中から返ることです。LLM のように答えの形が崩れて後ろの処理が止まることがないので、フローに組み込んだときに安定します。2 つ目は、確信度が返ることです。「確信度が高いものは自動で進め、低いものは人か上位の LLM に回す」という線を数字で引けるので、品質を保つ仕組みをそのまま作れます。3 つ目は、1 件あたりの費用がほぼかからないことです。費用を気にして一部だけ抜き取って確かめるのではなく、全件に確認を入れられます。
組み込み先としては、n8n のような業務自動化ツールとの相性がよいと考えています。Jev の答えを分岐の条件にそのまま使え、苦手な計算や日付の比較はツール側の処理に任せられるからです。n8n 用の公式の部品は見当たらないため、API を直接呼ぶ形になります。問い合わせ対応のチャットに使う場合は、返事を書くのは LLM、用件の判定や人への引き継ぎの判断は Jev、という分担にします。AI エージェントの基本はAI エージェントとは何かの記事にまとめています。
勧めるうえでの前提もはっきりさせておきます。Jev は申し込み制の早期提供で、はてなベースでもまだ実際には動かしていません。日本語の精度は公表されておらず、稼働の保証もありません。そのため、本番に入れる前に、過去の自社データに正解を付けて一致率を測ること、Jev が止まったときに従来のルールや人の確認に戻る経路を用意しておくことの 2 つを条件にします。今のうちに、業務の中から「形の決まった判断を大量にしている場所」を洗い出し、正解付きのデータを用意しておけば、日本語で使える段階になったときにすぐ判断できます。
AI を業務のどこに入れるかの設計からご一緒します
たとえば「問い合わせや書類の振り分けを自動化したいが、どのモデルをどう組み合わせれば費用が見合うか分からない」「AI に判断させる部分と人が見る部分の線引きを決めたい」といった場面で、既存の業務フローへの AI エージェントの組み込み設計と実装、AI が使えるように社内に散らばったデータを整える作業、社外にデータを出せない会社向けのオンプレミス環境での生成 AI 導入までご支援しています。