一則提問的長相
知乎的問題頁有一套固定版式:標題在最上面,提問說明接在底下,側欄照例掛著瀏覽與回答的計數。這則提問的標題是一句口語:「都說 GPT-6-Astra 強,有沒有實際點的應用案例?」模型名被連字號串起,前半是產品主線的代號,後半是這一輪新加的綴詞,接在後面的是一個問號。修辭從最正式的名詞直接落到最日常的口語,中間沒有過渡。
提問說明只有兩行,把話講得更白。寫的人自認非專業,官方數據讀不進去,各種測試得分看不出具體強在哪裡,於是想問:相對 GPT-5 系列,有沒有具體一點的提升案例。
這則提問值得當成一份使用者研究來讀。它標出了一次溝通在半路上失效的位置:實驗室端生產了一整套表達能力的格式,使用者端收到的只有陌生的數字。兩行字語氣客氣,但每個轉折都對著評分表上的一個缺口。
評分表的視覺文法
模型發表會與技術報告裡的評比圖,長相高度一致。左欄由上而下排開模型名,右側一組橫向長條,條尾綴著百分比,精確到小數點一位。本代模型那一列通常填上品牌色,前代與對手降為灰階,視線被引到唯一的高亮上。講究一點的圖會在長條頂端加一小段垂直線標示誤差,或在腳註交代測題數量與評分方式。任務名稱多數是英文縮寫,一行四五個字母,圈內人讀作常識,圈外人讀作密碼。
這套文法假設讀者帶著前提進場:知道前一版的分數,知道任務在測什麼,知道幾個百分點在這個領域的分量。少掉任何一個前提,圖仍然看得見,長條仍然比得出長短,意思卻進不來。
小數點一位本身也是修辭。多出來的那一位數讓分數顯得更科學,卻沒有讓它變得更好懂,精確度在這裡服務的是可信的印象,理解的負擔原封不動留給讀者。
最關鍵的門檻在參照點。長條圖的座標是模型對模型,使用者的座標是模型對我。更長的那一條,回答不了「昨天做不完的工作,今天會不會做得完」。兩個座標系之間沒有換算式,於是有了那則提問。
兩套數字系統
使用者並沒有排斥數字。同一則提問,平臺用一串十九位數來索引,網址列裡那排數字沒有人抱怨難懂,因為它從不要求被理解,只要求被複製。
差別在用法。平臺編號屬於後臺,使用者不必讀它;評分屬於前臺,被放進簡報正中央,卻只對受過訓練的眼睛說話。同一個產品週期裡還有第三種數字:訂閱層級與額度。我們先前拆過GPT-6 Astra 上線混亂背後的訂閱後綴階梯,Plus、Pro、Business、Business Premium、Enterprise 五層後綴,配上一天一次的額度重置。階梯的功能是分類帳,評分表的功能是成績單,使用者的問題剛好落在兩者中間:帳看得到,成績看不懂,那我到底買到了什麼。
版本號也在這套算術裡。從 GPT-5 到 GPT-6,整數位跳一級,命名上就承諾了一次代際更新,後面再綴 Astra,等於在代際之上又疊一層旗艦修辭。名字把期待拉到最高,文件卻用最小眾的格式收尾,中間的落差由問答區吸收。
案例是另一種介面
提問者要的「實際點的應用案例」,可以當成一種介面需求來讀。案例的骨架很固定:一個具體任務,一段可以複製的輸入,一次看得見的輸出。最要緊的是最後一個元素,一個真人願意給出的判斷。它把座標從模型對模型,搬回人對工具。
表達的形式也早已成熟。對話截圖自帶氣泡、字級與深色模式,螢幕錄製自帶時間軸與遊標的移動,前後對照則借用排版裡最古老的左右欄。這些都是裁切過的畫面,案例因此比分數好讀;也因為裁切過,它放掉了概括性,換來現場感。分數只能被引用,案例可以被重做,讀者拿同樣的輸入再跑一次,就是一次自己的驗收。
能力要被看見才會被相信,這件事在其他產品上已經演過一次。我們寫過DeepSeek 思考面板裡那格灰字:推理過程以次要資訊的排版攤開在介面上,模型的能力第一次有了可以捲動的形狀。一塊灰字面板做到的事,評分表一直沒做到,因為它讓使用者旁觀了過程。案例是同一個方向的另一種做法,讓使用者先旁觀別人的任務,再把它替換成自己的。
問題會被什麼滿足
這則提問最後會被什麼樣的答案填滿,不難預期。有人把評分表翻譯一遍,有人貼出自己試過的段落,兩種答案在留言區各自找到讀者,讚數接手了排序與把關。值得留意的是需求本身:在分數與口碑之間,缺一層由官方設計、給非專業眼睛看的表達。產品頁有規格表,說明書有常見問題,能力這一層目前由問答平臺代工。
評分表量測模型,案例量測人與工具之間的一段關係。版本號每跳一級,命名的承諾就加重一次,這層表達的缺席會越來越顯眼。下一場發表會,看長條圖之餘可以順便看簡報有沒有長出新的體裁:一段可複製的任務,一次並排的對照。有,表示有人讀懂了那則提問;沒有,問答區會繼續代工。