← 回部落格

Token 是什麼?看懂 AI 的計費單位(附成本試算)

大部分文章告訴你 token 是什麼就結束了,但你真正想知道的是下一個問題:這樣一個月要花多少錢?這篇把算式攤開,用一個 AI 客服的例子算到底。

Token 是什麼?看懂 AI 的計費單位(附成本試算)
Token(詞元):AI 處理文字的最小單位。英文大約每 4 個字元算 1 個 token,中文一個字通常要 1 到 2 個。幾乎所有 AI 服務都按 token 計費,且輸入與輸出分開計價。

「你 token 用太兇了」這句話,翻譯成人話就是「你這個月帳單很可觀」。

大部分講 token 的文章會告訴你它是什麼,然後就結束了。但你真正想知道的其實是下一個問題:這樣一個月要花多少錢?這篇會把算式攤開,用一個 AI 客服的例子算到底。

Token 是什麼?

AI 看不到「字」,它看到的是 token——一段文字被切成的小塊。切法不是按字也不是按詞,而是按訓練時統計出來的常見片段。

粗略的換算基準:

  • 英文:約 4 個字元 = 1 token。所以 customer service 大概是 2 到 3 個 token。
  • 中文:一個字約 1 到 2 個 token。OpenAI 官方說明給的基準是「1,000 個 token 約等於 750 個英文單詞或 500 個漢字」,也就是一個漢字約 2 個 token;較新的模型分詞更有效率,常用字往往只要 1 個。
  • 標點、空格、換行:也算,別忘了。

中文比英文吃 token,這件事會影響你的預算

同樣一段意思,中文的 token 數通常比英文多。換句話說,同一套 AI 服務,做中文生意的成本結構天生比做英文的差一些。這不是誰的問題,是分詞方式造成的,估算預算時要把它算進去,不要直接套用英文的案例數字。

為什麼是按 token 計費,而且輸入輸出分開算?

因為模型的運算量跟處理的 token 數直接相關。而輸出比輸入貴,各家模型大約落在 2 到 5 倍之間——因為輸入是一次讀完,輸出是一個 token 一個 token 逐步生成,運算成本高得多。

這帶出一個很實用的推論:讓 AI 少講話比讓它少讀東西更省錢。叫它「回答控制在 100 字以內」,省下的錢比你精簡問題來得多。

實際算一次:AI 客服一個月要多少錢

下面用一組示意費率來算。實際價格各家不同、而且會調整,請以你要用的服務當下的公告為準——這裡的重點是算法,不是這幾個數字。

假設費率是:輸入每百萬 token US$3、輸出每百萬 token US$15(這是目前中階模型常見的量級)。

算法三步

  1. 量出三個數字

    每則對話的輸入 token、輸出 token,以及每月對話則數。

  2. 套進算式

    月成本=(月則數×每則輸入 token÷1,000,000×輸入費率)+(月則數×每則輸出 token÷1,000,000×輸出費率)。

  3. 用實際數字驗算一次

    把自己站上的真實對話量代進去,先抓出量級,再去比較各家平台報價。

第一步:量出三個數字

  1. 每則對話的輸入 token=系統指令 + 撈進來的參考文件 + 對話歷史 + 客人這句話
  2. 每則對話的輸出 token=AI 回覆的長度
  3. 每月對話則數

第二步:套進算式

月成本 =(每月則數 × 每則輸入 token ÷ 1,000,000 × 輸入費率)+(每月則數 × 每則輸出 token ÷ 1,000,000 × 輸出費率)

第三步:一個實際的例子

一間有 LINE 官方帳號的店,每月大約 1,500 則客服訊息。設定是:系統指令 300 token、每次撈 2 段 FAQ 約 700 token、對話歷史約 500 token、客人問題約 50 token;AI 回覆平均 150 字,約 250 token。

項目數量計算費用
每則輸入 token1,550300 + 700 + 500 + 50
每則輸出 token250約 150 字
月輸入總量2,325,0001,500 × 1,550US$6.98
月輸出總量375,0001,500 × 250US$5.63
合計約 US$12.6(新台幣 400 元上下)

看到這個數字,多數人的第一反應是「比想像的便宜」。這是對的——純模型呼叫的成本通常不是主要開銷。真正的成本在平台費、知識庫建置、以及有人要去調校它。所以評估 AI 客服時,不要只比 token 單價。

但請注意上表裡最大的那一格:輸入 2,325,000,輸出只有 375,000。輸入量是輸出的六倍以上,而它幾乎全部來自系統指令、參考文件和對話歷史——不是客人講的話。這就是下一段的重點。

最容易爆預算的三個地方

一、每次都把整份 FAQ 塞進去

我們在幫客戶接 AI 客服時,最常看到的設定錯誤就是這個:為了「保險」,每次呼叫都把整份 20 頁的產品手冊放進 prompt。假設那是 30,000 token,1,500 則對話就是 4,500 萬 token,光輸入就要 US$135——是上面那個例子的十倍以上。

正確做法是 RAG:先用語意搜尋撈出最相關的 2 到 3 段,只把那幾段送進去。既省錢,答案品質通常還更好,因為模型不用在大量無關文字裡找重點。

二、對話歷史無限累積

如果你把整段對話歷史一路帶著跑,第 20 輪的輸入會是第 1 輪的好幾倍——而且每一輪都要重新付一次前面所有內容的錢。長對話的成本是往上加速的,不是線性的。

做法是設一個上限:只保留最近 N 輪,加上一段前文摘要。

三、用旗艦模型做瑣事

頂級模型和輕量模型的價差可以到十倍以上。判斷客人這句話屬於哪個類別、抓出訂單編號、判斷要不要轉真人——這些用輕量模型就夠了。把貴的模型留給真的需要推理的那幾步。

怎麼省,照影響力排序

  1. 改用 RAG,不要整包塞——通常一次砍掉大部分成本,且答案更準。
  2. 限制回覆長度——輸出單價最貴,「請在 100 字內回答」是一句話的優化。
  3. 對話歷史設上限——避免長對話成本失控。
  4. 分層用模型——簡單分類用便宜的,複雜推理才用貴的。
  5. 快取重複內容——多數服務對重複的系統指令有較低的快取費率,值得問清楚。

常見問題

1,000 個 token 大概是多少中文字?

約 500 到 1,000 字,取決於用字與模型。OpenAI 官方的保守基準是 1,000 token ≈ 500 漢字。但沒有一個換算比例對所有模型都準——要精確數字,把你的代表性文字丟進官方 Tokenizer 工具實測一次,比任何估算都可靠。

為什麼輸出比輸入貴?

輸入可以一次平行處理完,輸出必須一個 token 接一個 token 逐步生成,每一步都要跑完整個模型。運算量差很多,價格就反映這件事。

免費的 AI 工具也在算 token 嗎?

是,只是你看不到帳單——它體現成使用次數限制、速率限制或回覆長度上限。所謂「額度用完了」,背後就是 token 用完了。

圖片和語音怎麼算?

圖片通常按尺寸換算成一定數量的 token,一張圖可能等於數百到上千 token。語音多半按時長另外計價。要處理大量圖片時,先確認換算方式,否則很容易低估。

為什麼對話越長越吃 token?

因為每一輪都要把前面的對話重新送一次給模型——它沒有記憶,記憶是靠「把歷史一起貼上去」模擬的。所以第 20 輪的輸入可能是第 1 輪的好幾倍,而且那些內容你已經付過很多次錢了。解法是設對話歷史上限,或定期把前文壓成摘要。

怎麼知道自己實際用了多少?

每次 API 回應都會附帶這次的 token 用量,服務商後台也有用量報表。導入初期建議每週看一次——爆預算幾乎都是因為沒人在看,而不是因為單價貴。

那我到底該編多少預算?

以中小企業的 AI 客服來說,模型呼叫本身多半落在每月新台幣數百到數千元。但完整成本要算上平台月費與知識庫建置的一次性人力。先用上面的算式抓出模型成本的量級,再去比較各家平台的報價,才不會被單一數字誤導。

小結

Token 是 AI 的計價單位,而你的帳單幾乎完全由三件事決定:你每次餵進去多少東西、你讓它講多長、以及你用哪一級的模型。三者都是可以設計的,不是只能被動接受。

最重要的一個觀念:輸入量往往是輸出的好幾倍,而輸入大多來自你自己的設定,不是客人的問題。所以優化的第一刀永遠是砍輸入——把整包塞改成 RAG。

接下來可以看 LLM 是什麼?為什麼它很會講話,卻會講錯,或回到 AI 名詞白話對照表

資料來源(本文最後更新:2026 年 8 月 19 日)

文中的費率為示意值,用來示範算法。各家定價不同且會調整,實際編列預算請以你要用的服務當下的公告價為準。

限時免費

AI 變現全修班

九大 AI 接案技能,從架網站、代操廣告到做電商,一次解鎖。

免費報名

還是不確定哪個適合你?預約線上諮詢