OJTOKEN / INSIGHT

中转站 token 怎么算钱?输入输出、缓存命中与省钱技巧

一、token 是计价的唯一单位

模型不按“次数”收费,而按 token 计费。中文大致 1 个字约等于 1 个 token,英文单词平均 1.3 个 token 左右。一次请求的成本 = 输入 token × 输入单价 + 输出 token × 输出单价。

二、输入与输出为什么分开标价

输出是模型逐字生成的,算力消耗更高,因此输出单价通常是输入的 2–4 倍。控制输出长度最有效的办法,是在提示词里明确字数与格式要求,而不是事后过滤。

三、缓存命中价格为什么低

如果多次请求的前缀内容相同(例如固定的系统提示、同一份长文档),上游可以复用已计算的上下文,这部分按缓存命中价格计费,通常只有正常输入价的十分之一甚至更低。把稳定不变的内容放在提示词前部,就能吃到这部分优惠。

四、分时计费与折扣

部分模型采用分时定价:工作日白天是高峰价,夜间与周末是低谷价;平台折扣会直接体现在价格表上,例如 7.9 折、9.5 折。批量离线任务安排在低谷时段执行,成本可以明显下降。

五、五个立刻能用的省钱技巧

  • 把固定说明放进系统提示,提高缓存命中率;
  • 长文档先做摘要再喂给模型,避免重复输入全文;
  • 轻量任务换轻量模型,不要用旗舰模型做分类打标;
  • 限制 max_tokens,避免模型“停不下来”;
  • 用用量报表按项目维度对账,及时发现异常调用。

中转站tokentoken计费中转站api

相关推荐

浏览模型与价格 → 查看接入文档