Token 是什麼?看懂 AI 的計費單位(附成本試算)
大部分文章告訴你 token 是什麼就結束了,但你真正想知道的是下一個問題:這樣一個月要花多少錢?這篇把算式攤開,用一個 AI 客服的例子算到底。

「你 token 用太兇了」這句話,翻譯成人話就是「你這個月帳單很可觀」。
大部分講 token 的文章會告訴你它是什麼,然後就結束了。但你真正想知道的其實是下一個問題:這樣一個月要花多少錢?這篇會把算式攤開,用一個 AI 客服的例子算到底。
Token 是什麼?
AI 看不到「字」,它看到的是 token——一段文字被切成的小塊。切法不是按字也不是按詞,而是按訓練時統計出來的常見片段。
粗略的換算基準:
- 英文:約 4 個字元 = 1 token。所以
customer service大概是 2 到 3 個 token。 - 中文:一個字約 1 到 2 個 token。OpenAI 官方說明給的基準是「1,000 個 token 約等於 750 個英文單詞或 500 個漢字」,也就是一個漢字約 2 個 token;較新的模型分詞更有效率,常用字往往只要 1 個。
- 標點、空格、換行:也算,別忘了。
中文比英文吃 token,這件事會影響你的預算
同樣一段意思,中文的 token 數通常比英文多。換句話說,同一套 AI 服務,做中文生意的成本結構天生比做英文的差一些。這不是誰的問題,是分詞方式造成的,估算預算時要把它算進去,不要直接套用英文的案例數字。
為什麼是按 token 計費,而且輸入輸出分開算?
因為模型的運算量跟處理的 token 數直接相關。而輸出比輸入貴,各家模型大約落在 2 到 5 倍之間——因為輸入是一次讀完,輸出是一個 token 一個 token 逐步生成,運算成本高得多。
這帶出一個很實用的推論:讓 AI 少講話比讓它少讀東西更省錢。叫它「回答控制在 100 字以內」,省下的錢比你精簡問題來得多。
實際算一次:AI 客服一個月要多少錢
下面用一組示意費率來算。實際價格各家不同、而且會調整,請以你要用的服務當下的公告為準——這裡的重點是算法,不是這幾個數字。
假設費率是:輸入每百萬 token US$3、輸出每百萬 token US$15(這是目前中階模型常見的量級)。
算法三步
- 量出三個數字
每則對話的輸入 token、輸出 token,以及每月對話則數。
- 套進算式
月成本=(月則數×每則輸入 token÷1,000,000×輸入費率)+(月則數×每則輸出 token÷1,000,000×輸出費率)。
- 用實際數字驗算一次
把自己站上的真實對話量代進去,先抓出量級,再去比較各家平台報價。
第一步:量出三個數字
- 每則對話的輸入 token=系統指令 + 撈進來的參考文件 + 對話歷史 + 客人這句話
- 每則對話的輸出 token=AI 回覆的長度
- 每月對話則數
第二步:套進算式
月成本 =(每月則數 × 每則輸入 token ÷ 1,000,000 × 輸入費率)+(每月則數 × 每則輸出 token ÷ 1,000,000 × 輸出費率)
第三步:一個實際的例子
一間有 LINE 官方帳號的店,每月大約 1,500 則客服訊息。設定是:系統指令 300 token、每次撈 2 段 FAQ 約 700 token、對話歷史約 500 token、客人問題約 50 token;AI 回覆平均 150 字,約 250 token。
| 項目 | 數量 | 計算 | 費用 |
|---|---|---|---|
| 每則輸入 token | 1,550 | 300 + 700 + 500 + 50 | — |
| 每則輸出 token | 250 | 約 150 字 | — |
| 月輸入總量 | 2,325,000 | 1,500 × 1,550 | US$6.98 |
| 月輸出總量 | 375,000 | 1,500 × 250 | US$5.63 |
| 合計 | — | — | 約 US$12.6(新台幣 400 元上下) |
看到這個數字,多數人的第一反應是「比想像的便宜」。這是對的——純模型呼叫的成本通常不是主要開銷。真正的成本在平台費、知識庫建置、以及有人要去調校它。所以評估 AI 客服時,不要只比 token 單價。
但請注意上表裡最大的那一格:輸入 2,325,000,輸出只有 375,000。輸入量是輸出的六倍以上,而它幾乎全部來自系統指令、參考文件和對話歷史——不是客人講的話。這就是下一段的重點。
最容易爆預算的三個地方
一、每次都把整份 FAQ 塞進去
我們在幫客戶接 AI 客服時,最常看到的設定錯誤就是這個:為了「保險」,每次呼叫都把整份 20 頁的產品手冊放進 prompt。假設那是 30,000 token,1,500 則對話就是 4,500 萬 token,光輸入就要 US$135——是上面那個例子的十倍以上。
正確做法是 RAG:先用語意搜尋撈出最相關的 2 到 3 段,只把那幾段送進去。既省錢,答案品質通常還更好,因為模型不用在大量無關文字裡找重點。
二、對話歷史無限累積
如果你把整段對話歷史一路帶著跑,第 20 輪的輸入會是第 1 輪的好幾倍——而且每一輪都要重新付一次前面所有內容的錢。長對話的成本是往上加速的,不是線性的。
做法是設一個上限:只保留最近 N 輪,加上一段前文摘要。
三、用旗艦模型做瑣事
頂級模型和輕量模型的價差可以到十倍以上。判斷客人這句話屬於哪個類別、抓出訂單編號、判斷要不要轉真人——這些用輕量模型就夠了。把貴的模型留給真的需要推理的那幾步。
怎麼省,照影響力排序
- 改用 RAG,不要整包塞——通常一次砍掉大部分成本,且答案更準。
- 限制回覆長度——輸出單價最貴,「請在 100 字內回答」是一句話的優化。
- 對話歷史設上限——避免長對話成本失控。
- 分層用模型——簡單分類用便宜的,複雜推理才用貴的。
- 快取重複內容——多數服務對重複的系統指令有較低的快取費率,值得問清楚。
常見問題
1,000 個 token 大概是多少中文字?
約 500 到 1,000 字,取決於用字與模型。OpenAI 官方的保守基準是 1,000 token ≈ 500 漢字。但沒有一個換算比例對所有模型都準——要精確數字,把你的代表性文字丟進官方 Tokenizer 工具實測一次,比任何估算都可靠。
為什麼輸出比輸入貴?
輸入可以一次平行處理完,輸出必須一個 token 接一個 token 逐步生成,每一步都要跑完整個模型。運算量差很多,價格就反映這件事。
免費的 AI 工具也在算 token 嗎?
是,只是你看不到帳單——它體現成使用次數限制、速率限制或回覆長度上限。所謂「額度用完了」,背後就是 token 用完了。
圖片和語音怎麼算?
圖片通常按尺寸換算成一定數量的 token,一張圖可能等於數百到上千 token。語音多半按時長另外計價。要處理大量圖片時,先確認換算方式,否則很容易低估。
為什麼對話越長越吃 token?
因為每一輪都要把前面的對話重新送一次給模型——它沒有記憶,記憶是靠「把歷史一起貼上去」模擬的。所以第 20 輪的輸入可能是第 1 輪的好幾倍,而且那些內容你已經付過很多次錢了。解法是設對話歷史上限,或定期把前文壓成摘要。
怎麼知道自己實際用了多少?
每次 API 回應都會附帶這次的 token 用量,服務商後台也有用量報表。導入初期建議每週看一次——爆預算幾乎都是因為沒人在看,而不是因為單價貴。
那我到底該編多少預算?
以中小企業的 AI 客服來說,模型呼叫本身多半落在每月新台幣數百到數千元。但完整成本要算上平台月費與知識庫建置的一次性人力。先用上面的算式抓出模型成本的量級,再去比較各家平台的報價,才不會被單一數字誤導。
小結
Token 是 AI 的計價單位,而你的帳單幾乎完全由三件事決定:你每次餵進去多少東西、你讓它講多長、以及你用哪一級的模型。三者都是可以設計的,不是只能被動接受。
最重要的一個觀念:輸入量往往是輸出的好幾倍,而輸入大多來自你自己的設定,不是客人的問題。所以優化的第一刀永遠是砍輸入——把整包塞改成 RAG。
接下來可以看 LLM 是什麼?為什麼它很會講話,卻會講錯,或回到 AI 名詞白話對照表。
資料來源(本文最後更新:2026 年 8 月 19 日)
- Token 換算基準:OpenAI Help Center — 什麼是 Token,以及如何計算?
- 精確計算工具:OpenAI Tokenizer
文中的費率為示意值,用來示範算法。各家定價不同且會調整,實際編列預算請以你要用的服務當下的公告價為準。
還是不確定哪個適合你?預約線上諮詢