WEKEN NEWS 週末哥的數據記錄
jevsystem-oneai分類ai工具評估typesafe

Jev 與 System One 模型評估:AI 分類一下太保守一下編數字,這類模型解的是哪一段

直接回答

Jev 是 TypeSafe 在 2026 年 9 月 15 日發表的 System One 模型,它不生成文字,只回傳三種有型別的決策:Choice 從定義好的選項挑一個、Score 照等級打分、Bool 回傳是的機率,每一種都附機率分布與信心值。輸入每百萬 token 0.042 美金、輸出免費、回應時間 70 到 500 毫秒。它適合「從固定選項裡選一個」的題目,不適合任何需要產出文字的工作。

週末哥

做 IG 帳號分析工具的時候,我要 AI 把使用者的貼文分成 8 種寫法。

第一版跑出來,24 篇只分到 8 篇。其他 16 篇全部被歸到 none。


我第一個反應是提示詞寫得不夠清楚,所以回去改。

第一版我寫的是「不像就不要硬塞」。想法是避免 AI 硬把不相關的貼文塞進某一類,結果它保守過頭,稍微邊緣的都丟掉。

改成「先問最接近哪一種,只有純生活片段才給 none」,同時把餵給它的文案從 80 字放寬到 120 字。

再跑,36 篇分到 35 篇。


問題解決了,但有件事我沒想通。

同一個模型、同一批資料,只因為換了一句話,結果從 33% 變成 97%。

而且反過來也會出事。同一個工具的另一段功能,我要 AI 根據使用者的自我介紹產生內容點子,實測連續四輪都出錯:第一輪太空泛、第二輪照抄我給的範例、第三輪自己寫出收入金額、第四輪編造學員人數。每一輪都改了提示詞,每一輪都冒出新的錯法。

這兩件事的共同點是:我要的是一個判斷,但模型給我的是一段文字,而那段文字每次都可能不一樣。


三天前,TypeSafe AI 發表了一個叫 Jev 的模型,正好在講這件事。

我把官方的發表文章與定價頁翻了一遍,這是他們自己的說法。

TypeSafe 把它叫作 System One 模型,定義是「為了做出快速、結構化、軟體可以直接使用的決策而建的新一類前沿模型」。

它跟你用過的所有 AI 差在一件事:它不生成文字。

你問它問題,它不寫答案給你,只回傳三種東西之一:

  • Choice:從事先定義好的選項裡挑一個,回傳選擇、每個選項的機率與信心值
  • Score:照你定義的等級打分數,一樣回傳機率與信心值
  • Bool:是非題,回傳是的機率
System One 模型與一般大型語言模型的根本差別,不是速度或價格,是輸出的型別。生成式模型輸出的是字串,所以同一個問題兩次可能得到兩種寫法;決策型模型輸出的是事先定義好的選項之一,所以它不可能給出選項以外的答案,也不會出現型別錯誤。

官方數字,我一項一項核對過:

  • 輸入每百萬 token 0.042 美金,輸出免費。官方首頁自己拿 Claude Fable 5.1 比,寫「輸入價格低 238 倍」
  • 端到端回應時間 70 到 500 毫秒,官方說在同類智能任務上比前沿模型快 40 到 200 倍
  • Choice 的選項上限是 255 個
  • 公司在 2026 年 9 月 15 日從隱身狀態出來,種子輪 4000 萬美金,Jev 是第一個公開的模型,目前是早期存取

拿這組規格回去對我踩過的兩個坑,對得非常準。

24 篇只分到 8 篇那個坑。 根源是「不像就不要硬塞」這句話把判斷權交回給模型,而生成式模型面對模糊地帶時,傾向給出最安全的輸出。決策型模型的做法不一樣,它回傳的是機率分布,你拿到的是「這篇有 61% 像 A、23% 像 B」,要不要收是你的程式決定,不是模型替你決定。

編造學員人數那個坑。 這個更直接:Jev 根本不生成數字,所以它編不出來。它只能從我給的選項裡挑。

樣本太少的坑。 我另外遇過一個情況,某個分類只有 2 篇貼文,算出來卻是 13.5 倍的表現差距。那個數字沒有意義,所以我寫了一條規則:樣本少於 3 筆就標「樣本少」而且不進入「最強」的結論。決策型模型回傳的信心值可以取代這條規則,而且更準,因為樣本多但模型本身不確定的情況,硬規則抓不到,信心值抓得到。


但我沒有實際用過 Jev。

它現在是早期存取,要申請。這篇文章裡所有關於 Jev 的數字都來自官方發表文與定價頁,關於分類踩坑的部分才是我自己跑出來的。這兩件事我分開寫,不混在一起講。

所以下面這段是適配性判斷,不是實測結論。


什麼題目該用、什麼題目不該用

判斷方法只有一句話:把你要 AI 做的事寫成一句話,看那句話能不能改寫成選擇題。

能改寫的:

  • 這篇貼文屬於 8 種寫法的哪一種
  • 這支廣告的開場鉤子是痛點型、數據型、還是故事型
  • 這則留言的情緒是正面、負面、還是中性
  • 這個商品頁的合規風險是高、中、低
  • 這封信該路由到客服、業務、還是技術

改寫不了的:

  • 幫我寫一版廣告文案
  • 把這篇文章縮成三句摘要
  • 翻譯這段話
  • 根據一個人的背景想 10 個點子

第二組全部需要產出新的文字,System One 模型做不到,那不是它的問題,是題目不對。

判斷一個任務適不適合決策型模型,不看任務難不難,看輸出的形狀。輸出如果是「從固定集合裡選一個」或「一個分數」或「是非」,就適合;輸出如果是「一段新的文字」,再簡單也不適合。

還有一個現實面的判斷。

我現在做的分類是跑在免費額度上的,所以 Jev 的價值對我不在便宜,在兩件事:

一是速度。700 多筆資料每筆問六個維度,生成式模型要跑好一段時間,而且免費額度會卡。決策型模型是一次平行回答完,這個量級的差別很明顯。

二是不會亂講。這點對做工具的人比省錢重要得多。使用者看到一個編造的數字,整個工具的信任就沒了。


最後講一件容易搞混的事。

這類模型不是來取代 ChatGPT 或 Claude 的。真正的用法是放在系統裡當判斷層:前面用生成式模型產出東西,中間用決策型模型做分類、評分、路由,後面再回到生成式模型產出給人看的內容。

我自己的工具就是這個形狀,只是中間那一段現在是用生成式模型硬做的。

會出事的地方,都在中間那一段。

常見問題

Jev 是什麼?跟 ChatGPT、Claude 差在哪?
Jev 是 TypeSafe AI 的 System One 模型,2026 年 9 月 15 日發表。最大的差別是它不生成文字,你問它問題,它不寫答案,只回傳三種有型別的決策:Choice、Score、Bool,每種都附機率分布與信心值。所以它沒辦法幫你寫文案或回信,但可以在 0.07 到 0.5 秒內判斷「這段文字屬於哪一類」。
AI 分類結果一下太保守一下亂編,是提示詞的問題嗎?
不一定。我做 IG 帳號分析工具時,第一版提示詞寫「不像就不要硬塞」,24 篇只分到 8 篇;改成「先問最接近哪一種,只有純生活片段才給 none」並把取樣文字從 80 字放寬到 120 字之後,36 篇分到 35 篇。提示詞確實有影響,但生成式模型本質上是在生成文字而不是在做選擇,所以同一個提示詞跑兩次結果可能不同。決策型模型的輸出是事先定義好的選項,不會出現選項以外的答案。
Jev 要多少錢?跟一般大型語言模型比呢?
輸入每百萬 token 0.042 美金,輸出免費。TypeSafe 官方拿 Claude Fable 5.1 比較,說輸入價格低 238 倍。以 700 多支廣告、每支問六個分類維度來估算,總 token 約 0.2M,成本不到 0.01 美金。
什麼情況下不應該用 Jev?
任何需要產出文字的工作都不該用,它根本不生成文字。寫文案、寫回信、摘要、翻譯、產點子全部不行。另外選項上限是 255 個,如果你的分類體系超過這個數量就要先分層。還有一點,它目前是早期存取,不是註冊就能用。
AI 分類出來的結果樣本太少怎麼辦?
要標註而不是照報。我實際遇到過某個分類只有 2 篇貼文,算出來卻是 13.5 倍的表現差距,那個數字沒有意義。做法是設一個門檻,樣本少於 3 筆就標「樣本少」而且不進入「最強」這類結論。決策型模型會回傳信心值,可以直接拿信心值當這個門檻的判準,不用自己另外寫規則。