有人丟給我一份報告,標題是「JEV模型深度解析:AI效率革命與成本優化報告」,問我一句話:這個到底怎麼幫我們省錢?
報告的結論很大:把Jev放在工作流的第一層,是「實現10倍以上效率提升與90%以上成本優化的最短路徑」。
這篇做三件事:拿官方文件逐條核對這份報告、拿我自己代操廣告工具的實際AI帳單算它能省到哪幾筆,再放上我們接Jev跑過一次的實測。
Jev是什麼,一段話講完
Jev是TypeSafe的模型,官方叫它System One模型。它不生成文字,只回傳三種東西:從選項裡挑一個、照等級打分、回答是或否的機率。
它在2026年9月開放早期存取,官方部落格寫端到端回應時間70到500毫秒。我之前寫過一篇完整的規格評估:Jev與System One模型評估。這篇只談錢。
Jev官方定價:輸入每百萬token 0.042美金,輸出免費。單次請求上限64k token,速率上限每分鐘1,200次請求。只吃文字,不收圖片、聲音、影片。英文準確度最好,中文有支援但官方說沒那麼好。
報告裡的說法,逐條對官方
我拿TypeSafe官網、官方部落格的發表文、官方文件的模型頁與已知弱點頁一條一條對。
| 報告說法 | 官方查證 | 結果 |
|---|---|---|
| 每百萬輸入token 0.04美金 | 官方寫0.042美金 | 對 |
| 輸出完全免費 | 官方原文Output tokens are free | 對 |
| 比ChatGPT便宜40到400倍 | 官網寫便宜444.6倍,官方自測、自承偏上緣 | 大致對 |
| ChatGPT共同創辦人開發 | 創辦人Diogo Almeida曾在OpenAI做研究 | 半對 |
444.6倍這個數字要多看一眼。官方部落格寫得很老實:這是他們自己的工作流評測,拿GPT-6 Astra和Fable 5.1兩個旗艦模型的平均答案當標準,對照的模型價格取自OpenRouter,而且他們自己預期這個數字偏向真實效益的上緣。
創辦人那條也是半對。部落格署名Diogo Almeida,他自述在OpenAI參與過讓語言模型能遵循指令、跟人對話的研究,那些研究後來成為ChatGPT背後的基礎。但「共同創辦人」這四個字,官方沒有說過。
另外三條要特別講。
「零幻覺」說得太滿。它確實不會亂寫字,因為它根本不寫字,但官方自己有一頁列出Jev 1.13會判斷錯的情況:不會可靠地數數、把日期當文字讀、分數等級之間的細微差距抓不準、指令一繞彎就容易錯。官方的建議是算數、數數、日期交給程式,Jev只負責語意判斷。
「透過OpenRouter接入」寫錯了用途。官方部落格確實提到OpenRouter,但那是拿來查對照模型的價格,不是說Jev透過它接入。「GitHub超過15,000顆星」官方沒提,我沒辦法確認。
還有一條報告沒提、但對台灣讀者最重要的:官方模型頁寫英文是主要訓練語言,中文「支援但沒那麼好」。這條我們有實測,放在後面。
我的AI帳單,錢花在哪裡
我代操廣告用的工具裡,AI花費有三個地方,數字都是從工具自己的花費紀錄撈出來的。
第一筆是寫廣告文案。同一個題目我比過四種設定,gpt-5.5一組NT$2.8,gpt-5.4-mini一組NT$0.2,品質看不出明顯差別,所以現在預設用mini。
第二筆是生廣告素材圖。gpt-image-2.5-flare,1024乘1024中等品質,不帶參考圖一張US$0.014。
這兩筆有一個共同點:輸出都是新東西。一段文案、一張圖。Jev不寫字也不生圖,這兩筆它一塊都替代不了。
第三筆比較有意思。再行銷文案我用兩段式:便宜的模型每個切角先寫3版,再交給gpt-5.5當總監,照6個問題打分、挑出最好的一版,然後改寫成定稿。
這個總監其實做了兩件事。打分挑選是判斷,改寫是生成。前半段正好是Jev的題目,後半段不是。所以就算在我自己的工具裡,能交給Jev的也只有打分挑選那一部分。
Jev能省的錢,上限是你AI花費裡「判斷步驟」的那一塊。寫文案、寫回信、摘要、翻譯、生圖都是生成工作,Jev一塊都替代不了。一個AI花費幾乎都在生成的團隊,導入Jev的帳單變化接近零。
所以「省90%以上」這句話,要看你是誰。
如果你有一條工作流,每天用Claude或ChatGPT幫幾萬封信分類、幫幾萬則留言判斷正負面,那一段換成Jev確實可能省很多,官網的數字是便宜444.6倍,但官方自己說這是上緣。
至少我自己的情況,AI的錢絕大部分花在寫東西、生東西上,判斷只有總監打分挑選那一部分。錢不在Jev能省的地方。
我們實際跑過一次
這不是紙上談兵。我們在另一個分析IG帳號的工具裡,把「貼文寫法分類」這一步換成了Jev。
任務是把36篇繁體中文IG貼文,分進8種寫法。一篇一個請求,36個請求同時發(正式版後來改成一批12個,不要一次開太多連線)。
結果:整批0.737秒,單次中位數0.615秒。輸入共28,305個token,一次掃描約台幣0.04元。原本的對照組是另一個開源模型,三支判斷一起跑要5.9秒。兩邊的題數不同,不能直接相除算幾倍快。
Jev實測:36篇繁體中文IG貼文分成8種寫法,一篇一個請求、36個同時發,整批0.737秒,輸入28,305個token,約台幣0.04元。同一批跑兩次,信心值0.6以上的21篇全部一致,0.6以下的15篇只有11篇一致。
中文的部分,繁體的題目和選項它都吃得下。穩不穩,我們用同一批跑兩次來看:信心值0.6以上的21篇,兩次結果全部一致;0.6以下的15篇,只有11篇一致。所以我們把0.6定成門檻,低於門檻的不直接採用。要注意,這驗的是穩定,不是對錯:兩次都錯得一樣也會算一致,準確率要另外跟人工標註比,這一步我們還沒做。
還踩到一個省錢陷阱。把36篇塞進同一個請求、每篇一題,輸入少了30%,可是答案只有13篇跟一篇一題的結果一致。官方文件說題目之間互相看不到,實測起來還是會互相干擾。要準就一篇一個請求,多花的30%值得。
它真正省的是另一種錢
回到廣告工具,Jev的價值不在現有帳單,在「以前太貴所以沒做的事」。
我有一個廣告興趣標籤的資料庫,8,839個標籤。現在找標籤的做法是讓AI想十幾個出來,再去資料庫查。原因很單純:讓AI把8,839個全部讀一遍、逐一判斷適不適合,用生成式模型太慢也太貴。
換成Jev,這件事變成:每個標籤問一題「這群人會不會對它有興趣」,打一個分數。照上面實測,一次請求平均約786個token(那一題的輸入是整篇貼文,標籤題會短很多,所以下面的9元是偏高的估計),8,839個全部掃一遍約695萬token,照官方定價約0.29美金,以1美金約32台幣計約台幣9元。這一題我還沒跑,是用實測的每次用量估的。
同一個邏輯可以套到另外四件事:
- 廣告底下的留言,全部自動分成客訴、問問題、想買、垃圾,想買和客訴優先回
- 幾百則商品評論,先挑出有講具體痛點的,再交給貴的模型深讀
- 廣告文案送審之前,先判斷有沒有誇大效能、保證效果這類明顯問題,有的直接退回
- 前面講的總監,把「打分挑一版」拆出來交給Jev,只把改寫留給gpt-5.5
標籤打分和前三件都是「從全部裡面挑」,以前的做法是抽樣或乾脆不做;第4件總監,是現有帳單裡能省的那一小段。Jev主要省的是前面那種錢:不是讓你現在的帳單變小,是讓你原本付不起的判斷變得付得起。
8,839個廣告興趣標籤逐一打分,以實測每次請求約786個token估算,全部約695萬token,照Jev官方定價輸入每百萬token 0.042美金,約0.29美金、台幣9元。這是用實測用量推的估算,標籤這一題本身還沒跑。
換新任務前要先驗的一件事
每換一個新的判斷題,都要重新驗一次準確率。
貼文分類那一題我們驗過穩定度,還沒跟人工比過準確率;留言分類、標籤打分又是不同的題目。我的做法會是挑100筆真實資料讓Jev跑,同時人工標一次,比兩邊一致的比例,再看信心值門檻要設在哪。
這一輪測試的成本,照實測每次約786個token估算,100筆約7.9萬token,照官方定價約0.0033美金,大約台幣0.1元。貴的是驗證的時間,不是AI的錢。
判斷一個AI工具能不能省錢,先看它能接手的那一段,佔你帳單幾成。