拆開一次 API 回應,裡面沒有句子。三個小數並排靠在選項後面:問價 0.71,砍價 0.05,下單前確認 0.24。送進去的材料是一條直播間彈幕,「9.9 三袋真從倉庫發?」,拿回來的東西比彈幕本身還短。三個數字加總為一,一份完整的判斷被壓縮進三位小數的排版裡。
這是 2026 年 9 月開發者圈討論最熱的新模型 Jev 的輸出介面。它來自一家叫 TypeSafe AI 的公司,隱身兩年,第一次露面就帶著四千萬美元的種子輪,由 DCVC 領投。創辦人 Diogo Almeida 在 OpenAI 時期參與過 InstructGPT 那一支研究,那批工作教會大模型聽懂人話、把話說明白。繞了一圈,他端出來的產品卻以幾乎不說話為賣點:它會做的事只有一件,從你給定的選項裡挑一個,不寫文章,也不生成程式碼。
採用的速度少見。發布第二天,Vercel 宣布把它接進 AI Gateway,隔一天 Netlify 跟上。再過兩天,Vercel 發了一篇部落格,標題直譯過來是「AI Gateway 史上採用最快的模型」。上線 24 小時,接近百分之十三的付費團隊已經在用它,是過去任何一次模型發布首日的兩倍多。
把答案做成小數
Jev 的問法一共三種。選擇題 Choice 由你定義選項,它挑出一個,並把每個選項的機率一併還給你,開頭那組 0.71、0.05、0.24 就是它的完整作答。打分題 Score 先由你定義量表,例如一到五分的購買意向,它回傳一個數,而且這個數允許落在兩檔中間,4.3 屬於正常輸出。是非題 Noul 的答案最短,問它這條彈幕帶不帶售後情緒,它回一個 0.12。
三種問法單看都不算新鮮,值得留意的是下一層的結構:它們可以放進同一次呼叫,一起算完。對話模型回答三個問題,得寫完第一題再寫第二題,因為它的輸出是一個字接一個字生成的。Jev 換了一種做法,同一份材料只讀一次,幾個問題平行評估。官方文件的說法是,往同一個請求裡繼續增加問題,回應時間幾乎不變。你的程式於是一次拿到一組結構化的數字:把握度高的直接執行,兩個選項咬得緊的轉給更貴的模型再看一遍,實在拿不準的交給人。
一百毫秒與 0.042 美元
時間與價格在 Jev 的規格表上是兩枚材料。官方給出的延遲區間是端到端 70 到 500 毫秒,多數落在一百毫秒上下,而人眨一次眼需要兩三百毫秒。換句話說,多數時候你還來不及眨眼,判斷已經回到程式裡。價格欄的排版更直白:每百萬輸入 token 收 0.042 美元,輸出免費。
「輸出免費」這四個字值得單獨看一會。生成式模型的帳單大頭在輸出,文字是一個 token 一個 token 蹦出來的,每一個都實打實計費。你只需要它說「A 團隊」,前面那幾百字的過場照樣算錢。Jev 是判別式的,直接給每個選項一個機率,省掉的恰恰是別人省不掉的那部分。因為它不寫,輸出欄的計價於是為零。介面的形態直接兌現成價目表上的數字,這種因果在軟體產品裡並不常見。
把帳算細一點:每次判斷餵一千 token,一百萬次判斷大約是十億 token,42 美元。同樣這批小判斷換成某家大模型的結構化輸出,帳單會落在幾百到幾千美元的量級。這種把價格當成規格一部分攤開來寫的做法,和宇樹 Dex5-S 靈巧手那串三點九九萬的定價排版屬於同一門手藝:數字本身扛著說服力,比任何形容詞都省事。
它補上的那塊短板
現在的 AI 應用,中間層太囉嗦。用戶只看到最後那段回答,前面是一長串判斷:這步該調哪個工具,檢索回來的材料有沒有用,這條操作要不要攔下來,出錯了該重試、問用戶還是直接停。每一步都由一個模型替你做主,而擅長寫文章的模型,連「要不要攔」都要先鋪一百多字的分析才肯收尾。幾十步走完,用戶早把頁面關了,那一長串答案裡的一大半,其實只值一個字。
Vercel 部落格裡給 Jev 列的用法,正好對準這些縫隙:選下一個工具或下一層代理,決定流程要繼續、重試、問人還是停,給緊急度和風險打分,檢查別的模型輸出得對不對,沒把握的轉人工。全是判斷,沒有一樣需要寫文章。TypeSafe 的產品主張可以壓縮成一句話:只要判斷,就別讓模型寫作文。
「沒把握的轉人工」這一條讀起來眼熟。我們先前拆解過AI 客服把真人當作規格的設計,裡面的難題是機器服務找不到通往真人的出口。Jev 把這個出口本身做成一道可計價的判斷題,什麼時候該交給人,先由一個小數來決定。
少做的勇氣
判斷一個任務適不適合交給 Jev,官方給的篩選條件有三條:這個判斷會不會重複很多次,答案的範圍能不能提前列清楚,判斷的依據是不是自然語言。三條都佔,它就合適。這套邊界本身就是好的設計規格,清楚、可執行、不貪心。
過去兩年,模型的競爭軸線是誰說得更多、更流利、更有文採,介面越做越像人,開場白、語氣詞、免責聲明一路加碼。Jev 把軸線轉了九十度,比誰說得更少、更快、更便宜。它的介面裡找不到聊天框,也沒有擬人語氣,問題、選項、機率,就是畫面上的全部內容。把擬人化全部拆掉之後,程式不需要猜它在想什麼,數字承載了全部的意思。
這種節制在設計行業裡向來最難。在沒有人要求你少做的時候主動少做,把輸出欄縮到三個小數,把單價壓到 0.042,把回應時間藏進一次眨眼之內。回應欄裡那三個小數沒有任何表情,卻比一段流利的分析更像答案。當 AI 應用的中間層擠滿了急著發言的模型,一個閉嘴的介面成了稀缺品。判斷交給小數,書寫留給真正需要書寫的場合,這條分工線畫下來之後,說話這件事,反而變貴了。