做 IG 帳號分析工具的時候,我要 AI 把使用者的貼文分成 8 種寫法。
第一版跑出來,24 篇只分到 8 篇。其他 16 篇全部被歸到 none。
我第一個反應是提示詞寫得不夠清楚,所以回去改。
第一版我寫的是「不像就不要硬塞」。想法是避免 AI 硬把不相關的貼文塞進某一類,結果它保守過頭,稍微邊緣的都丟掉。
改成「先問最接近哪一種,只有純生活片段才給 none」,同時把餵給它的文案從 80 字放寬到 120 字。
再跑,36 篇分到 35 篇。
問題解決了,但有件事我沒想通。
同一個模型、同一批資料,只因為換了一句話,結果從 33% 變成 97%。
而且反過來也會出事。同一個工具的另一段功能,我要 AI 根據使用者的自我介紹產生內容點子,實測連續四輪都出錯:第一輪太空泛、第二輪照抄我給的範例、第三輪自己寫出收入金額、第四輪編造學員人數。每一輪都改了提示詞,每一輪都冒出新的錯法。
這兩件事的共同點是:我要的是一個判斷,但模型給我的是一段文字,而那段文字每次都可能不一樣。
三天前,TypeSafe AI 發表了一個叫 Jev 的模型,正好在講這件事。
我把官方的發表文章與定價頁翻了一遍,這是他們自己的說法。
TypeSafe 把它叫作 System One 模型,定義是「為了做出快速、結構化、軟體可以直接使用的決策而建的新一類前沿模型」。
它跟你用過的所有 AI 差在一件事:它不生成文字。
你問它問題,它不寫答案給你,只回傳三種東西之一:
- Choice:從事先定義好的選項裡挑一個,回傳選擇、每個選項的機率與信心值
- Score:照你定義的等級打分數,一樣回傳機率與信心值
- Bool:是非題,回傳是的機率
官方數字,我一項一項核對過:
- 輸入每百萬 token 0.042 美金,輸出免費。官方首頁自己拿 Claude Fable 5.1 比,寫「輸入價格低 238 倍」
- 端到端回應時間 70 到 500 毫秒,官方說在同類智能任務上比前沿模型快 40 到 200 倍
- Choice 的選項上限是 255 個
- 公司在 2026 年 9 月 15 日從隱身狀態出來,種子輪 4000 萬美金,Jev 是第一個公開的模型,目前是早期存取
拿這組規格回去對我踩過的兩個坑,對得非常準。
24 篇只分到 8 篇那個坑。 根源是「不像就不要硬塞」這句話把判斷權交回給模型,而生成式模型面對模糊地帶時,傾向給出最安全的輸出。決策型模型的做法不一樣,它回傳的是機率分布,你拿到的是「這篇有 61% 像 A、23% 像 B」,要不要收是你的程式決定,不是模型替你決定。
編造學員人數那個坑。 這個更直接:Jev 根本不生成數字,所以它編不出來。它只能從我給的選項裡挑。
樣本太少的坑。 我另外遇過一個情況,某個分類只有 2 篇貼文,算出來卻是 13.5 倍的表現差距。那個數字沒有意義,所以我寫了一條規則:樣本少於 3 筆就標「樣本少」而且不進入「最強」的結論。決策型模型回傳的信心值可以取代這條規則,而且更準,因為樣本多但模型本身不確定的情況,硬規則抓不到,信心值抓得到。
但我沒有實際用過 Jev。
它現在是早期存取,要申請。這篇文章裡所有關於 Jev 的數字都來自官方發表文與定價頁,關於分類踩坑的部分才是我自己跑出來的。這兩件事我分開寫,不混在一起講。
所以下面這段是適配性判斷,不是實測結論。
什麼題目該用、什麼題目不該用
判斷方法只有一句話:把你要 AI 做的事寫成一句話,看那句話能不能改寫成選擇題。
能改寫的:
- 這篇貼文屬於 8 種寫法的哪一種
- 這支廣告的開場鉤子是痛點型、數據型、還是故事型
- 這則留言的情緒是正面、負面、還是中性
- 這個商品頁的合規風險是高、中、低
- 這封信該路由到客服、業務、還是技術
改寫不了的:
- 幫我寫一版廣告文案
- 把這篇文章縮成三句摘要
- 翻譯這段話
- 根據一個人的背景想 10 個點子
第二組全部需要產出新的文字,System One 模型做不到,那不是它的問題,是題目不對。
還有一個現實面的判斷。
我現在做的分類是跑在免費額度上的,所以 Jev 的價值對我不在便宜,在兩件事:
一是速度。700 多筆資料每筆問六個維度,生成式模型要跑好一段時間,而且免費額度會卡。決策型模型是一次平行回答完,這個量級的差別很明顯。
二是不會亂講。這點對做工具的人比省錢重要得多。使用者看到一個編造的數字,整個工具的信任就沒了。
最後講一件容易搞混的事。
這類模型不是來取代 ChatGPT 或 Claude 的。真正的用法是放在系統裡當判斷層:前面用生成式模型產出東西,中間用決策型模型做分類、評分、路由,後面再回到生成式模型產出給人看的內容。
我自己的工具就是這個形狀,只是中間那一段現在是用生成式模型硬做的。
會出事的地方,都在中間那一段。