我做的帳號分析工具曾經跟我說,反主流觀點這種寫法我一次都沒試過,去試試看。
實際上那是我最強的寫法:9篇確定加7篇疑似,相對表現2.06倍,全帳號最高。工具在叫我去做一件我已經做得最好的事。
問題出在分類模型。第一版用來判斷我36篇貼文各屬於哪一種寫法的模型,把反主流觀點判成0篇。這種模型不管懂不懂,都會給一個肯定的答案,分類錯了不會噴錯、不會讓任何檢查失敗,畫面看起來完全正常。
分類錯誤不會讓程式報錯,也不會被檢查抓到,它會被當成正常結果送進統計,變成一句語氣肯定、方向卻相反的建議。
真正的解不是換一個比較準的模型。換成會回傳信心分數的模型之後,兩邊都還是會分錯,差別在於這次每一筆結果都附一個信心值。有分數就能設閘門:不夠確定的不給單一答案,改成這篇同時像哪幾種。
上一篇評估過這類會回傳信心分數的決策型模型,這篇是實際接上之後,門檻怎麼定出來的。
接下來的問題是,門檻要設多少。不能憑感覺取0.7或0.8。做法是把同一批輸入原封不動跑兩次,比對兩次答案的一致率。信心達到0.6的21篇,兩次跑出來完全一致,21篇對21篇;信心低於0.6的15篇,只有11篇一致。分界自己跳出來,不是用猜的。
36篇貼文原封不動跑兩次分類,信心0.6以上的21篇兩次答案21/21一致,信心0.6以下的15篇只有11/15一致,門檻就是這樣測出來的。
這個測試順便驗證了一件事:信心分數是真的,不是模型隨便吐一個數字出來湊數。
門檻設下去,代價立刻出現。可用樣本從35篇掉到18篇,0.6的門檻在正式掃描時擋掉17篇,跟兩次比對時的15篇不是同一次統計(兩次比對用的是36篇,正式掃描的樣本是35篇)。看起來是變弱,實際上是個發現:以前那35篇裡,有將近一半是硬塞進分類的。
擋掉的17篇,不是分類器分不出來,是八種寫法的定義本身互相重疊,例如反主流觀點跟拆解為什麼兩種寫法,本來就常一起出現,這種內容本來就同時像兩種寫法。換誰來分都一樣。模型分不出來的時候,先懷疑是類別設計的問題,不是模型的問題。
這個發現也定出被擋掉的樣本該怎麼處理。模糊帶不是丟掉,介面上照實寫「另外有N篇同時像兩種寫法」,我自己看了會點頭,比硬給一個答案有用。而且模糊帶裡出現過的類別,不准被系統說成使用者沒用過,這一條規則就是專門補回開頭那個錯:反主流觀點原本被判0篇,其實是我做得最好的寫法。
信心門檻不是為了讓分類器看起來更嚴謹,是為了不讓機器的自信變成使用者的反向建議。沒有信心分數的分類器,永遠沒辦法承認自己不知道。