AI客服要不要開放自由問答?我的LINE Bot跑5個月246人,最後關掉閒聊只留8個指令
直接回答
我關掉AI自由問答的原因不是模型不好,是我沒有給它完整的資料,而它面對缺口不會閉嘴,會自己填。填出來的答案又會延伸出更多問題。我的LINE Bot上線5個月、246位使用者,最近1000次功能互動裡有116次是系統聽不懂的輸入,佔11.6%,在開放自由問答的架構下這116次全部由模型自由發揮。2026年6月改成只留8個固定指令,非指令一律導回功能選單。
我的LINE Bot在2026年4月上線,到現在跑了5個月,246位夥伴註冊使用。
它一開始有兩層:8個固定關鍵字指令,加上一層Claude Haiku的自由對話。使用者打指令走指令,打別的就交給模型自由發揮。
2026年6月,我把自由發揮那一層關掉了。非指令輸入一律回一段引導文字加功能選單。
—
先講數字,這是我從後台拉出來的真實記錄,不是印象。
最近1000次功能事件的分布:庫存查詢181次、商品列表149次、風向資訊連結133次、被導回功能選單116次、主動叫出選單87次、素材庫41次、課程報名22次、問卷20次。
庫存相關的兩項加起來330次,佔33%。而累積被查詢過的商品有1,239個。
246位使用者、5個月、最近1000次互動:查庫存與商品列表330次佔33%,系統聽不懂的輸入116次佔11.6%。使用者要的是查得準,不是聊得好。
這張表把我原本的假設打掉了。
我做的時候想的是「一個什麼都能問的AI助理」,實際上使用者拿它當查詢工具用。三分之一的互動是在問同一件事:這個商品還有沒有貨。
—
最近數位時代寫了SUPER 8的AI員工平台ORRA,裡面那套框架很值得參考:把AI當新人來帶,分成招募、訓練、考核、上線後管理四個階段,考核那段是部署前要通過畢業考、按目標評分,上線後有虛擬考核官看對話紀錄跟工作報告。
創辦人陳子龍在裡面講了一句我很同意的話:使用AI agent最大的問題是它不知道你是誰、你的公司在做什麼,所以他把它當新人入職來處理。
我自己跑5個月之後的發現是:在幫AI做畢業考之前,有一件更前面的事要先決定,就是它能講幾句話。
—
我當初關掉自由問答的原因很簡單:我沒有給它完整的資料,它就會亂答,然後延伸出一堆問題。
這句話裡有兩件事,第二件比第一件重要。
第一件是知識庫不可能完整。快電商的商品每天在變、規則會調整、夥伴會問我從來沒想過的東西。任何一個AI客服的知識庫都是不完整的,這不是能力問題,是常態。
第二件是模型面對缺口的預設反應是填滿它,不是承認它。它不會說「這個我的資料裡沒有」,它會給你一個看起來很合理的答案。而且語氣跟正確答案完全一樣,你分不出來。
知識庫不完整是所有AI客服的常態。真正的問題是模型面對缺口的預設反應是填滿它、不是承認它,而且亂答的語氣跟正確答案完全一樣。
然後是延伸出來的那些問題。一個亂答不會只是一個錯,夥伴會照著做、會回頭再問一次、會轉述給其他人。一句錯的答案在一個200多人的群體裡會走很遠,而你完全看不到它走到哪。
—
那116次「系統聽不懂的輸入」,就是這件事的量化版本。
在有自由對話的架構下,這116次會全部進到模型手裡,由它自己決定要回什麼。而這裡面包含了打錯字、閒聊、問了系統根本沒有的功能、以及各種我沒設計過的情況。
模型會答,而且會答得很順。問題是沒有人知道它答了什麼,也沒有人知道它答錯了幾次。
關掉之後,那116次變成一個明確的落點:一段引導文字加功能選單,而且每一次都被記錄下來。
這份記錄現在是我最有用的東西之一。它是一份「使用者想做但系統做不到」的清單,直接告訴我下一個功能該做什麼。
—
比關掉自由對話更早的一個決定,是把QA功能從生成改成檢索。
原本的做法是把問答資料丟給模型,讓它讀完之後自己組織答案。這個做法的問題不是答得不好,是你永遠不知道它什麼時候會多講一句沒有依據的話。
現在的做法是兩段式:模型讀完題庫之後只回傳一個題號,系統再拿那個題號去試算表撈原文,原封不動回給使用者。
模型不生成任何一個字。
降低AI幻覺最有效的做法不是改提示詞,是不讓模型寫答案。讓它只回傳題號,系統用題號去資料庫撈原文回傳。這是拿掉能力,不是降低機率。
在提示詞裡寫「不要編造」是降低機率,不讓它生成是拿掉能力。前者會在你沒看到的時候失效,後者不會。
—
模型的選擇也是踩出來的。
一開始整套用Gemini 2.5 Flash,自己測沒問題。等到夥伴們同時在用的時候開始出現503,而且是在最需要它的時段。
現在的分層是:對話那一層換成Claude Haiku,選題號那一層留給Gemini並且把thinking budget設成0,因為那個動作只要輸出一個數字,不需要它思考。
即使分層了,最近200筆錯誤記錄裡還是有9筆是Gemini的5xx。所以分層不是為了省錢,是為了讓其中一邊出問題的時候另一邊還活著。
—
回到ORRA那套四階段。
招募跟訓練我有,考核跟上線後管理我沒有。這是我看完文章之後認的,而且準備補上:建一份50到100題的真實問題題庫配標準答案,每次改完自動跑一次,通過率不到門檻就不准上線。
但順序不能顛倒。
先關掉自由發揮,錯誤的可能性從「模型任何時候都可能亂講」變成「只有題庫裡的答案可能過時」。這時候題庫才測得完,也才測得準。
反過來先做畢業考再開放自由對話,你會發現題庫永遠測不完,因為使用者的輸入是無限的。
—
5個月下來我學到的是:AI客服真正的風險不在模型答得好不好,在你的資料有沒有缺口,以及缺口出現的時候誰在補。
你的知識庫永遠會有缺口。要嘛讓模型去補,要嘛讓系統老實說沒有。
那116次被導回選單的互動,看起來像是失敗,實際上是這個系統最誠實的部分。