weken.news
ai客服line botai agentclaude haiku第一手數據

AI客服要不要開放自由問答?我的LINE Bot跑5個月246人,最後關掉閒聊只留8個指令

直接回答

我關掉AI自由問答的原因不是模型不好,是我沒有給它完整的資料,而它面對缺口不會閉嘴,會自己填。填出來的答案又會延伸出更多問題。我的LINE Bot上線5個月、246位使用者,最近1000次功能互動裡有116次是系統聽不懂的輸入,佔11.6%,在開放自由問答的架構下這116次全部由模型自由發揮。2026年6月改成只留8個固定指令,非指令一律導回功能選單。

週末哥 ·

我的LINE Bot在2026年4月上線,到現在跑了5個月,246位夥伴註冊使用。

它一開始有兩層:8個固定關鍵字指令,加上一層Claude Haiku的自由對話。使用者打指令走指令,打別的就交給模型自由發揮。

2026年6月,我把自由發揮那一層關掉了。非指令輸入一律回一段引導文字加功能選單。

先講數字,這是我從後台拉出來的真實記錄,不是印象。

最近1000次功能事件的分布:庫存查詢181次、商品列表149次、風向資訊連結133次、被導回功能選單116次、主動叫出選單87次、素材庫41次、課程報名22次、問卷20次。

庫存相關的兩項加起來330次,佔33%。而累積被查詢過的商品有1,239個。

246位使用者、5個月、最近1000次互動:查庫存與商品列表330次佔33%,系統聽不懂的輸入116次佔11.6%。使用者要的是查得準,不是聊得好。

這張表把我原本的假設打掉了。

我做的時候想的是「一個什麼都能問的AI助理」,實際上使用者拿它當查詢工具用。三分之一的互動是在問同一件事:這個商品還有沒有貨。

最近數位時代寫了SUPER 8的AI員工平台ORRA,裡面那套框架很值得參考:把AI當新人來帶,分成招募、訓練、考核、上線後管理四個階段,考核那段是部署前要通過畢業考、按目標評分,上線後有虛擬考核官看對話紀錄跟工作報告。

創辦人陳子龍在裡面講了一句我很同意的話:使用AI agent最大的問題是它不知道你是誰、你的公司在做什麼,所以他把它當新人入職來處理。

我自己跑5個月之後的發現是:在幫AI做畢業考之前,有一件更前面的事要先決定,就是它能講幾句話。

我當初關掉自由問答的原因很簡單:我沒有給它完整的資料,它就會亂答,然後延伸出一堆問題。

這句話裡有兩件事,第二件比第一件重要。

第一件是知識庫不可能完整。快電商的商品每天在變、規則會調整、夥伴會問我從來沒想過的東西。任何一個AI客服的知識庫都是不完整的,這不是能力問題,是常態。

第二件是模型面對缺口的預設反應是填滿它,不是承認它。它不會說「這個我的資料裡沒有」,它會給你一個看起來很合理的答案。而且語氣跟正確答案完全一樣,你分不出來。

知識庫不完整是所有AI客服的常態。真正的問題是模型面對缺口的預設反應是填滿它、不是承認它,而且亂答的語氣跟正確答案完全一樣。

然後是延伸出來的那些問題。一個亂答不會只是一個錯,夥伴會照著做、會回頭再問一次、會轉述給其他人。一句錯的答案在一個200多人的群體裡會走很遠,而你完全看不到它走到哪。

那116次「系統聽不懂的輸入」,就是這件事的量化版本。

在有自由對話的架構下,這116次會全部進到模型手裡,由它自己決定要回什麼。而這裡面包含了打錯字、閒聊、問了系統根本沒有的功能、以及各種我沒設計過的情況。

模型會答,而且會答得很順。問題是沒有人知道它答了什麼,也沒有人知道它答錯了幾次。

關掉之後,那116次變成一個明確的落點:一段引導文字加功能選單,而且每一次都被記錄下來。

這份記錄現在是我最有用的東西之一。它是一份「使用者想做但系統做不到」的清單,直接告訴我下一個功能該做什麼。

比關掉自由對話更早的一個決定,是把QA功能從生成改成檢索。

原本的做法是把問答資料丟給模型,讓它讀完之後自己組織答案。這個做法的問題不是答得不好,是你永遠不知道它什麼時候會多講一句沒有依據的話。

現在的做法是兩段式:模型讀完題庫之後只回傳一個題號,系統再拿那個題號去試算表撈原文,原封不動回給使用者。

模型不生成任何一個字。

降低AI幻覺最有效的做法不是改提示詞,是不讓模型寫答案。讓它只回傳題號,系統用題號去資料庫撈原文回傳。這是拿掉能力,不是降低機率。

在提示詞裡寫「不要編造」是降低機率,不讓它生成是拿掉能力。前者會在你沒看到的時候失效,後者不會。

模型的選擇也是踩出來的。

一開始整套用Gemini 2.5 Flash,自己測沒問題。等到夥伴們同時在用的時候開始出現503,而且是在最需要它的時段。

現在的分層是:對話那一層換成Claude Haiku,選題號那一層留給Gemini並且把thinking budget設成0,因為那個動作只要輸出一個數字,不需要它思考。

即使分層了,最近200筆錯誤記錄裡還是有9筆是Gemini的5xx。所以分層不是為了省錢,是為了讓其中一邊出問題的時候另一邊還活著。

回到ORRA那套四階段。

招募跟訓練我有,考核跟上線後管理我沒有。這是我看完文章之後認的,而且準備補上:建一份50到100題的真實問題題庫配標準答案,每次改完自動跑一次,通過率不到門檻就不准上線。

但順序不能顛倒。

先關掉自由發揮,錯誤的可能性從「模型任何時候都可能亂講」變成「只有題庫裡的答案可能過時」。這時候題庫才測得完,也才測得準。

反過來先做畢業考再開放自由對話,你會發現題庫永遠測不完,因為使用者的輸入是無限的。

5個月下來我學到的是:AI客服真正的風險不在模型答得好不好,在你的資料有沒有缺口,以及缺口出現的時候誰在補。

你的知識庫永遠會有缺口。要嘛讓模型去補,要嘛讓系統老實說沒有。

那116次被導回選單的互動,看起來像是失敗,實際上是這個系統最誠實的部分。

常見問題

AI客服為什麼會亂答?知識庫不完整會怎樣?
因為模型面對資料缺口的預設反應是填滿它,不是承認它。你的知識庫不可能完整,這是所有AI客服的真實狀態,而缺的那一塊模型不會告訴你,它會補一個看起來很合理的答案。更麻煩的是一個亂答不會只是一個錯,使用者照著做、回頭再問、或是轉述給別人,會延伸出一串問題。我的解法是不讓它生成:模型只回傳題號,系統用題號去資料庫撈原文。
AI客服開放自由問答和只給固定指令,差別在哪?
差在出錯的時候誰負責。固定指令答錯是你的資料錯,改資料就好;自由問答答錯是模型的判斷錯,你只能改提示詞再祈禱。我的後台記錄顯示,最近1000次功能互動裡有116次是使用者輸入了系統不認識的內容,佔11.6%。在開放自由問答的架構下,這116次全部會變成模型自由發揮的答案,而且沒有人會知道它答了什麼。
什麼情況下才應該開放AI自由問答?
答錯的代價低、而且答案本來就沒有標準答案的時候。閒聊、發想、寫作草稿這類適合。反過來說,只要答案有對錯(庫存數量、價格、規則、法規),就不該讓模型自己生成,該用檢索加原文回傳。判斷句是:這個問題答錯了,使用者會不會照著做然後出事。
LINE Bot接Gemini還是Claude Haiku比較好?
看併發。我一開始用Gemini 2.5 Flash,單人測試沒問題,但多位夥伴同時使用時開始出現503。後來把對話那一層換成Claude Haiku,選題號那一層留給Gemini並把thinking budget設成0省額度。到現在最近200筆錯誤記錄裡還是有9筆是Gemini的5xx,所以分層是必要的,不是為了省錢。
AI agent要不要做上線前的畢業考?
要,但那是第二步。第一步是先決定它能講幾句話。畢業考測的是「它答得對不對」,而限制輸出範圍決定的是「它有沒有機會答錯」。我跑5個月的順序是先把自由發揮關掉,讓錯誤的可能性降下來,剩下的才值得花力氣去測。兩件事一起做,測試題庫會小很多也準很多。