2026-07-22

如何在运行批量任务前精准估算 LLM API 成本

详解 OpenAI、Anthropic 与 Google 各大模型 Token 计费公式,提供 1 万次批量请求的真实美金成本算例与优化策略。

大规模跑 LLM 任务前不先估算 Token 用量,账单很容易毫无预兆地冲上去。无论是批量生成 1 万条商品描述,还是给一堆客服工单做摘要,只要把计费公式算清楚,成本在动手前就能算出来。

本文将详细解析 LLM API 的核心计费公式,对比主流大模型在 2026 年的每百万 Token 价格,并针对 1 万次批量请求场景给出实际算例。


1. LLM API 核心计费公式

各大 LLM 服务商(OpenAI、Anthropic、Google)均按处理的 Token 数量计费。Token 费用分为两个独立部分:

  1. 输入 Token (Prompt):传入模型的提示词、上下文或代码。
  2. 输出 Token (Completion):模型生成的文本内容。

单次请求的美金成本计算公式为:

$$\text{单次成本} = \left(\frac{\text{输入 Token}}{1,000,000} \times \text{输入每 1M 单价}\right) + \left(\frac{\text{输出 Token}}{1,000,000} \times \text{输出每 1M 单价}\right)$$

对于包含 $N$ 次请求的批量任务,总成本计算公式为:

$$\text{总成本} = N \times \text{单次平均成本}$$


2. 主流模型价格基准表(2026 年每 100 万 Token)

不同阶梯模型的 API 价格差异巨大。下表总结了目前主流 pay-as-you-go 模式下的标准价格(单位:美元):

服务商模型名称输入单价 ($ / 1M)输出单价 ($ / 1M)上下文窗口
OpenAIGPT-4o$2.50$10.00128K
OpenAIGPT-4o-mini$0.15$0.60128K
AnthropicClaude 3.5 Sonnet$3.00$15.00200K
AnthropicClaude 3.5 Haiku$0.80$4.00200K
GoogleGemini 1.5 Pro$1.25$5.002M
GoogleGemini 1.5 Flash$0.075$0.301M

注:上述为标准实时 API 价格。若使用 Batch API 批量接口(如 OpenAI Batch API 或 Anthropic Message Batches),通常可享受 24 小时异步处理的 5 折优惠。


3. 真实算例:10,000 条客服工单摘要提取

假设有一个典型的企业自动化场景:处理 10,000 条历史客服工单并提取关键摘要。

  • 平均提示词长度:1,200 个英文单词 / 中文字(约 1,500 输入 Token)。
  • 平均摘要输出:150 字(约 200 输出 Token)。
  • 总输入 Token:$10,000 \times 1,500 = 15,000,000$ Token(15M 输入)。
  • 总输出 Token:$10,000 \times 200 = 2,000,000$ Token(2M 输出)。

各模型总成本对比:

  1. 使用 GPT-4o

    • 输入成本:$15 \text{M} \times $2.50 = $37.50$
    • 输出成本:$2 \text{M} \times $10.00 = $20.00$
    • 总批量成本$57.50
  2. 使用 Claude 3.5 Sonnet

    • Input Cost:$15 \text{M} \times $3.00 = $45.00$
    • Output Cost:$2 \text{M} \times $15.00 = $30.00$
    • 总批量成本$75.00
  3. 使用 GPT-4o-mini

    • 输入成本:$15 \text{M} \times $0.15 = $2.25$
    • 输出成本:$2 \text{M} \times $0.60 = $1.20$
    • 总批量成本$3.45
  4. 使用 Gemini 1.5 Flash

    • 输入成本:$15 \text{M} \times $0.075 = $1.125$
    • 输出成本:$2 \text{M} \times $0.30 = $0.60$
    • 总批量成本$1.725

核心结论:对于简单的分类或摘要提取,将任务路由到 GPT-4o-miniGemini 1.5 Flash 等轻量级模型,可在保证业务效果的同时降本 95% 以上(从 $57.50 降至 $1.72)。


4. Token 预算管理最佳实践

  1. 提前切片分词:切勿仅凭字符数粗略估计。英文通常 4 字符折算 1 Token,但代码与中文等 CJK 字符在部分分词器中可能达到 1-2 Token/字。
  2. 利用提示词缓存:将固定系统提示词(System Prompt)利用 Prompt Caching 机制保存,减少重复计费。
  3. 在发请求前先计算:在编写脚本前,先把提示词样板放入在线计算器中核对。

需要即时估算自己的提示词 Token 数并对比各大模型美元成本?可以使用我们免费的 Token 与成本计算器