← 回部落格

LLM 是什麼?大型語言模型為何很會講話,卻會產生 AI 幻覺

它講起話來像個很有把握的專家——而那個語氣正好是最危險的地方,因為自信程度跟正確程度沒有關係。這篇講清楚 LLM(大型語言模型)到底在做什麼、生成式 AI 為什麼會產生幻覺,以及什麼情況下你可以信它。

LLM 是什麼?大型語言模型為何很會講話,卻會產生 AI 幻覺
LLM(Large Language Model,大型語言模型):讀過極大量文字後,學會預測「下一個字最可能是什麼」的 AI 模型。它產生語言的方式是機率計算,不是查詢資料庫——這是它既流暢又會出錯的根本原因。

ChatGPT、Claude、Gemini、以及你手邊那個「AI 助理」,底下跑的都是 LLM。它們最讓人驚訝的地方通常不是知識量,而是語氣——講起話來像個很有把握的專家。

而那個語氣,正好是最危險的地方。因為它的自信程度跟正確程度沒有關係。這篇要講清楚它到底在做什麼,以及在什麼情況下你可以信它。

LLM 到底在做什麼?

它在做一件事:看著已經有的文字,預測下一個字最可能是什麼。就這樣,反覆做幾百次,就成了一段回答。

舉個例子。你輸入「台北的天氣今天很」,模型會算出各種可能的下一個字及其機率:「熱」可能佔 40%、「冷」20%、「悶」8%、「好」5%……然後挑一個,接上去,再用「台北的天氣今天很熱」去預測下一個字。一路接到句子結束。

所謂「大型」指的是它讀過的文字量和內部參數的數量都極大。參數可以粗略理解成它腦中的旋鈕數量——越多,它能記住的語言規律就越細緻。

為什麼只是預測下一個字,就能寫出通順的文章?

因為要在幾兆字的文本裡把「下一個字」猜得夠準,它被迫學會了語法、常見事實、文章結構、甚至推理的表面形式。這些不是有人一條一條教它的,是猜字這個任務逼出來的副產品。

這也解釋了一件事:它學到的是「什麼樣的文字看起來對」,不是「什麼是真的」。這兩件事在絕大多數句子上重疊,所以它多半是對的;但它們並不是同一件事,所以它會錯。

為什麼它會一臉正經地講錯?

原因一:它沒有在查資料

你問它一個問題,它不是去哪裡找答案再告訴你,而是生成一個「看起來像答案的東西」。所以當它不知道時,它不會空白——它會產生一段語法完美、格式正確、但內容是編的文字。這就是幻覺(hallucination)

最典型的表現是「假引用」:它給你一個看起來完全合理的法條編號、論文標題或網址,你去查才發現不存在。因為在它的機率世界裡,那個位置本來就該出現一個「像法條編號的東西」。

原因二:它的知識有截止日,而且不知道自己不知道

模型的知識來自訓練時讀過的資料,之後發生的事它不知道。麻煩的是它沒有察覺自己過期了,所以會用現在式講一件已經改變的事——價格、法規、產品規格都可能是舊的。

原因三:它被訓練成「要給答案」

模型在訓練過程中,被人類評分者偏好「有幫助的回答」。結果是:說「我不知道」通常拿不到高分,給出一個具體答案比較討喜。這個偏好被學進去之後,就變成一種寧願猜也不願空手的傾向。

我們在客戶站台上最常遇到的就是這件事:一個沒有接上自家資料的 AI 客服,被問到「你們幾點打烊」時,它不會說查不到,它會給你一個很像營業時間的時間。

那什麼時候可以信它?

可以用一個簡單的標準判斷:這個任務的答案,是「寫出來」的還是「查出來」的?

任務類型可信度為什麼
改寫、潤稿、換語氣原始資訊是你給的,它只負責重組語言
摘要你提供的文件答案就在你給的文字裡,不需要它自己生
發想、腦力激盪你要的就是多樣性,正確性不是重點
翻譯、分類、整理格式中高規則明確,但專有名詞仍要抽查
寫程式能跑就知道對不對,錯了立刻現形
查具體事實(價格、法規、規格)它在生成不是查詢,且知識可能過期
算數字、對帳它預測的是「看起來像答案的數字」
引用來源、給連結很低最容易編造,且看起來最像真的

一句話總結:把資料給它、讓它處理語言,可信度就高;要它自己回想事實,就要驗證。

這不只是經驗談,實測數據的分布跟這張表幾乎一致。2025 年多項幻覺率評測顯示:有原文可依據的摘要任務,幻覺率低於 2%;封閉式問答落在 10–20%;開放式生成則高達 40–80%;而法律類的引用生成最糟,落在 58–88%(綜合 2025 年 HALoGEN 等基準與產業評測)。換句話說,「給它資料」和「要它自己想」之間的差距,是一個數量級。

怎麼讓它變得可靠?

做法一:把資料餵給它,不要靠它回想

與其問「你們的退貨政策是什麼」,不如把退貨政策那份文件一起送進去,再問「根據這份文件,客人買七天後可以退嗎」。前者是考它記憶,後者是叫它讀理解——後者的錯誤率低得多。

把這件事系統化、讓它每次回答前都自動去撈相關文件,就是 RAG(檢索增強生成)。這也是目前企業級 AI 客服的標準做法。

效果有多大?一份 2025 年發表在 Communications Medicine 的研究用 300 個經醫師驗證的臨床情境測試多個模型,未經處理時整體幻覺率是 65.9%;加上結構化的防幻覺指令之後降到 44.2%,表現最好的 GPT-4o 從 53% 降到 23%。光是把「依據什麼回答」講清楚,就能砍掉一半以上的錯誤。

做法二:給它「可以說不知道」的許可

在指令裡明確寫出:找不到依據時就回答不知道,不要推測。這一句話對降低幻覺的效果,比大部分人以為的都大。我們自己的客服設定裡,這是預設行為——答不出來就轉真人,而不是硬掰。

做法三:把 temperature 調低

temperature 控制輸出的隨機程度。客服、法務、報價這類場景要調低,讓同一個問題每次都得到同樣的答案;發想文案、想標題才需要調高。

常見問題

LLM 和 ChatGPT 有什麼不一樣?

LLM 是技術類別,ChatGPT 是產品。就像「引擎」和「某一款車」的關係。ChatGPT 底下是 OpenAI 的 GPT 系列模型,Claude 底下是 Anthropic 的模型,都屬於 LLM。

參數越多的模型就一定越好嗎?

不一定。參數量只是其中一個因素,訓練資料品質、訓練方法、以及是否針對特定任務優化都會影響結果。實務上更該問的是「它在我這個任務上表現如何」,而不是比參數。

為什麼同一個問題問兩次,答案不一樣?

因為它是在機率分布中抽樣,不是查表。每次抽到的字可能不同,答案就會有差異。把 temperature 調到最低可以讓輸出趨於穩定,但通常不保證每次完全一致。

LLM 會不會偷偷學走我輸入的資料?

取決於你用哪個服務、以及該服務的資料政策。多數企業方案明確承諾不將 API 輸入用於訓練,但免費的消費者版本條款通常不同。處理客戶個資或營業機密前,先把這條看清楚。

要不要自己訓練一個模型?

對絕大多數中小企業,不用。從零訓練的成本是天文數字,就算只做微調,也貴、慢、而且它改的是語氣不是知識。你想要的「讓 AI 懂我家的事」,用 RAG 成本低太多。

它真的「理解」我在說什麼嗎?

這是個哲學問題,但對做決策的人來說有個實用版本的答案:它的行為在很多任務上足以當成理解來用,但它沒有「知道自己錯了」的機制。所以你可以放心讓它處理語言,但要幫它把事實把關。

小結

LLM 是一台非常強的語言處理機器,不是一本百科全書。理解這一點,你對它的期待就會落在對的地方:把資料交給它,它幫你處理表達;要它自己回想事實,你就得驗證。

接下來建議看這兩篇:Token 是什麼?看懂 AI 的計費單位(搞懂用 AI 的錢怎麼算),或回到AI 名詞白話對照表把其餘名詞一次補齊。

資料來源(本文最後更新:2026 年 8 月 19 日)

數據會隨模型版本變動,引用時請以原始報告的發表時間為準。

限時免費

AI 變現全修班

九大 AI 接案技能,從架網站、代操廣告到做電商,一次解鎖。

免費報名

還是不確定哪個適合你?預約線上諮詢