跳至主要內容

觀點 · Essay

從表單裡那排單選鈕,到名稱裡那個 decide:Jev 決策模型的設計語言

一款不寫段落、只回傳預設答案的模型在發布後迅速做到日處理一兆個 Token,本文從表單單選欄的介面語言讀起,看決策模型的輸出規格、吞吐設計與兩週內排滿 decide 的命名貨架。

設計觀察 ·
從表單裡那排單選鈕,到名稱裡那個 decide:Jev 決策模型的設計語言

先從一個介面設計裡的老元件說起。單選鈕在表單上佔的位置很小,設計它的人卻握有極大的裁量權:所有可能的答案在開發階段就被枚舉完畢,使用者只是走進格子裡挑一個。隔壁的自由文字欄性格相反,什麼都能填,也因此難以預料。表單設計師在這兩種欄位之間拿捏了幾十年,原則很樸素:高頻而且關鍵、要進資料庫的欄位,收斂成選項;真正開放的問題,才交給文字。

九月十五日,一家名為 TypeSafe AI 的新創結束低調營運,發布了模型 Jev。到了十月五日,《華爾街日報》給出成績單:每日處理量達到一兆個 Token,約四分之一的《財星》500 大企業在用,業務還在指數成長。這個模型做的事,說穿了是把表單的老原則搬進模型層。它的工作方式與聊天機器人不同:借助機器學習,把輸入內容歸類到一組預先設定好的輸出裡。答案非是即否,或者是一個數值評分;欄位若設定成清單,它就從中勾出一項。公司把這套思路稱作「面向校準決策的強化學習」。

單選欄的模型版

輸出被限縮到這種程度,畫面上幾乎沒有「生成」可言。回應欄位短得像儀表上的讀數:一格布林值,或一格分數,或清單裡的一個編號。設計的趣味在比例。輸入可以是一整段合約、一封客訴、一筆交易紀錄,輸出端卻始終只有一格,資訊在模型裡被極度壓縮,壓到只剩決策本身。

TypeSafe AI 的創辦人迪奧戈・阿爾梅達(Diogo Almeida)曾參與 ChatGPT 的研發,二〇二四年離開 OpenAI。他對主流大型語言模型的評語很直接:有人盯著看時,它們可以完成任務;放進自動化場景,效果「差得離譜」。關鍵在可預期性。同樣的輸入,聊天機器人可能給出不同的措辭與不同的結論;只輸出預設答案的模型則天生帶著可複現的性質,同一筆輸入對應同一格輸出,像一枚規格明確的電子元件。阿爾梅達在受訪時把這件事講成軟體常識:

引述 TypeSafe AI 創辦人阿爾梅達的說明,軟體以穩定底層逐層疊加並反覆呼叫,而聊天機器人缺乏這種可供疊加的運作模式

這段話其實是一份介面契約的描述。可以疊加、可以反覆呼叫、行為可預期,這些本是元件庫對一顆按鈕的基本要求,過去三年卻很少被拿來要求一個模型。Jev 把這些要求重新寫回了規格表。

一兆 Token 的吞吐設計

每日一兆個 Token,是在模型發布後約一週達成的數字。這個量級撐得起來,輸出端的節制功不可沒:輸入再長,輸出只有一格,單次呼叫的開銷自然輕薄。高頻、量大、單筆極短,這是排程系統的體質,也是 Jev 被定位成適合嵌入自動化軟體的原因。聊天機器人的輸出像信件,它的輸出像開關。一兆這個數字也說明了它的使用姿態:模型被埋在系統深處,每一筆經過的資料都問它一次,問題很短,答案更短。

資本市場很快替這份規格定了價。TypeSafe AI 此前從創投 DCVC 拿到四千萬美元;《The Information》九月底披露,公司正洽談新一輪融資,目標十億美元起跳,部分意向投資人給出的估值已超過一百億美元。阿爾梅達對融資消息不願多談。數字先擺在一邊,值得注意的是市場定價的對象:一個輸出欄位只有一格的模型。

統計圖卡呈現 Jev 模型的單日處理量達到一兆個 Token,此規模約在模型發布後一週內達成
發布後約一週的單日吞吐量

貨架上排滿了 decide

跟進者的速度,寫在各家產品的名稱裡。OpenAI 在九月底上線 Decisions API,底層是自家的 Luna 模型,用途寫得明白:回答一組使用者自設的特定問題,答案被限定在若幹預先定義好的結果之內。Databricks 隔天發布 ai_decide,名稱採工程界熟悉的蛇形命名法,小寫加底線,看起來像程式裡的一個函式,是拿來呼叫的,對話感降到最低。Cloudflare 走開源路線,推出 Clef 與 Clef-flash。Amazon 此前的 Strands Decider 2B 也排在同一條路線上,把二十億參數寫進名字,屬於規格表式的誠實排版。

decide 這個動詞在兩週內被排上四面貨架。名稱的長度也值得看:Jev 三個字母,放進程式碼裡像個變數名;Luna 同樣短。這波短名作風並不陌生,先前讀過的GPT-6.1 Sol 的三字母命名就是同一套長度直覺,產品名稱往指令的方向靠,離招牌愈來愈遠。至於 TypeSafe AI 本身,名字借自程式語言的「型別安全」,等於把可靠兩個字焊進了公司名。

清單圖卡列出與 Jev 同路線的四項決策模型產品:OpenAI 的 Decisions API、Databricks 的 ai_decide、Cloudflare 的 Clef 系列,以及 Amazon 的 Strands Decider 2B

Cloudflare 的做法在工程細節上最有設計感。Clef 與 Clef-flash 以 Qwen3.8-27B 和 Qwen3.5-9B 作為凍結的基礎模型,只加上一個專用的路由頭,直接對候選答案打分數,不做逐 Token 的自回歸生成。整個組裝接近模組化硬體的思路:底盤沿用現成品且不再更動,負責做選擇的讀出裝置另行安裝。Clef 這個字在樂譜上是譜號,負責告訴你接下來的音怎麼讀;用在一個只做判讀、不做鋪陳的模型上,取名算是準確。

分工的版面

《華爾街日報》的報導裡有一句整理:一個新的模型類別正在成形,生成式模型負責複雜推理,決策模型負責高頻而選項有限的工作,包括路由、分類、審批與 AI 代理的下一步動作。這份分工像一份版面的配置原則:長文交給文字欄,問卷交給單選欄,兩種欄位各有各的段落。過去三年,AI 的主介面隱喻是聊天框,開放而健談;Jev 與跟風者把另一個更老、更安靜的元件推回檯面。

OpenAI 的動作尤其值得對照。Decisions API 被排進產品線的位置,與先前拆解過的OpenAI 從模型、建構到分發的三步排版屬於同一張版面,決策功能被當成基礎建設在鋪設,這格欄位在巨頭眼裡的分量可想而知。

阿爾梅達早就預料到會有跟風者,他仍相信 Jev 的能力與智慧化程度更高,並稱這是「全新一類人工智慧」的開端,希望帶動業界更認真地討論大型語言模型的替代方案。從設計的角度看,這場熱潮驗證的是一條表單設計的老規矩:想讓答案可用,先限制答案的形狀。聊天框擅長打開話題,單選欄擅長收攏工程。當模型從展示廳走進流水線,輸出欄位的規格,比生成的華麗更接近產品的成敗。