AI Gateway 计费说明
本文介绍云器 AI Gateway 国内区(人民币计价)模型的计费方式、价格口径、缓存计费规则和国内模型列表价。价格用于帮助用户在接入前估算成本,实际费用请以 模型广场详情页、用量统计页面和最终账单 为准。
价格来源参考产品价格配置表与模型广场展示口径。本文仅采用国内人民币(RMB)列表价;飞书表格中的美元(USD)价格不纳入本章。模型市场价格可能随供应商、模型版本、接入点、区域和产品策略调整。
我该看哪张表
如果只想快速确认某类模型怎么计费,可以按下表选择阅读位置。
| 使用目标 | 建议查看 |
|---|---|
| 调用 Qwen、DeepSeek、GLM、Kimi、MiniMax、豆包文本模型 | 查看 和对应模型系列价格表。 |
| 想知道缓存为什么更便宜 | 查看 。 |
| 使用 HappyHorse 视频模型 | 查看 ,该系列按秒计费。 |
| 使用豆包 Seedance 视频模型 | 查看 ,该系列按百万 Tokens 计费。 |
| 使用豆包 Seedream 图片模型 | 查看 。 |
| 使用 3D 生成模型 | 查看 。 |
| 使用 Embedding / 向量模型 | 查看 。 |
| 想估算一次调用大概多少钱 | 查看 。 |
| 想核对实际账单 | 查看 。 |
价格口径
| 口径 | 说明 |
|---|---|
/ | 本文列出的公开价格口径,用于成本估算和模型选型。 |
| 模型广场可能展示客户折扣后的价格,实际以页面和账单为准。 |
| 最终出账使用的价格,可能受折扣、接入点、BYOK、供应商账单周期等因素影响。 |
| 使用平台内置供应商产生的费用,可在用量统计中查看。 |
| 使用用户自有云厂商 Key 产生的费用,通常由用户在云厂商侧结算。 |
计费方式
AI Gateway 按需计费。调用模型 API 时,系统按当次实际消耗的 Tokens、时长、张数或任务量累计计费。
| 特性 | 说明 |
|---|---|
| 无最低消费门槛,按实际调用量计费。 |
| 每次模型调用都会记录请求量、Token、计费量和成本。 |
| 可在用量统计中按 API Key 查看具体业务消耗。 |
| 可在用量统计中查看各模型的请求数、Token 和费用。 |
| 账单通常按月汇总,最终金额以账单为准。 |
Token 与缓存计费
文本模型 Token 计费
按 Token 计费的对话模型通常区分
输入 和 输出:
| 字段 | 含义 |
|---|---|
| 用户请求中 prompt、messages、上下文等输入内容的 Token 单价。 |
| 模型生成内容的 Token 单价。 |
| 部分模型按上下文窗口分段计价,长上下文可能对应更高单价。 |
文本模型费用通常按以下公式估算:
示例:输入 1,000 tokens,输出 2,000 tokens;输入价 2 元/M Tokens,输出价 8 元/M Tokens:
缓存能省多少钱
如果业务反复发送相同的长系统提示词、知识库文档或固定上下文,模型可以复用已处理过的前缀内容,这就是缓存。缓存命中的单价通常低于普通输入价,因此适合长 Prompt、多轮对话和 Agent 工作流。
缓存主要分为两类:
| 类型 | 工作方式 | 价格表字段 |
|---|---|---|
| 用户或接口主动声明要缓存某段内容。首次写入可能收取写入费,后续命中按较低命中价计费。 | 、、 |
| 系统自动识别重复前缀并复用,无需用户显式声明。 | |
各列含义:
| 字段 | 说明 |
|---|---|
| 首次把一段 Prompt 写入缓存时收取。 |
| 后续请求命中显式缓存时收取。 |
| 系统自动识别重复内容并命中时收取。 |
| 部分模型会对缓存内容按存储时长收取费用。 |
非文本模型计费
视频、图片、3D 和向量模型不一定按普通文本 Token 计费,接入前应先确认模型详情页中的计费单位。
| 模型类型 | 计费说明 |
|---|---|
| HappyHorse 系列按生成视频时长计费,单位为元/秒;豆包 Seedance 系列按百万 Tokens 计费,并按是否含视频输入、输出分辨率等维度分档。 |
| 豆包 Seedream 系列按百万 Tokens 计费,文生图、图生图同价。 |
| 豆包 Seed3D、Hyper3D、Hitem3D 按百万 Tokens 计费,并按白模、纹理、PBR、精度等规格分档。 |
| Qwen3 VL Embedding、豆包 doubao-embedding-vision 按输入数据类型分别计价,文本输入价格低于图片 / 视频输入。 |
价格阅读说明
| 字段 | 说明 |
|---|---|
| 输入 / 输出 | 按 Token 计费的模型分别记录请求输入与模型输出的单价。 |
| 缓存创建 | 包含 5 分钟、1 小时与未分 TTL 三类独立价格列;仅在该模型的原始价格记录有值时展示。 |
| 缓存命中 | 读取显式缓存或命中缓存时的单价。 |
| 隐式缓存命中 | 系统自动复用重复前缀时的单价。 |
| 价格规格 | 上下文窗口、输入类型、分辨率、是否带视频输入等影响价格的条件。 |
除非表中另行标注,Token 类模型价格单位为 每百万 Tokens。
— 表示该列未在当前工作表中配置,不表示免费或不支持该项能力。
费用估算
文本模型基础费用可按以下方式预估:
若请求产生缓存创建、缓存命中或隐式缓存命中,应按表内对应列的实际用量另外计算。视频、图片、3D 与向量模型应按本页显示的时长、张数、Token 或任务规格计费。
模型价格
文本模型价格
| 厂商 | 模型名称 | 价格规格 | 输入 | 输出 | 缓存创建(5 分钟) | 缓存创建(1 小时) | 缓存创建(未分 TTL) | 缓存命中 | 隐式缓存命中 | 计费单位 |
|---|---|---|---|---|---|---|---|---|---|---|
| Alibaba Cloud / Qwen | | 0–128K | 0.2 | 2 | — | — | 0.25 | 0.02 | — | M tokens |
| Alibaba Cloud / Qwen | | 128K–256K | 0.8 | 8 | — | — | 1 | 0.08 | — | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 1.2 | 12 | — | — | 1.5 | 0.12 | — | M tokens |
| Alibaba Cloud / Qwen | | 0–256K | 1.2 | 7.2 | — | — | 1.5 | 0.12 | — | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 4.8 | 28.8 | — | — | 6 | 0.48 | — | M tokens |
| Alibaba Cloud / Qwen | | 0–32K | 0.2 | 0.8 | — | — | 0.24 | 0.02 | 0.04 | M tokens |
| Alibaba Cloud / Qwen | | 32K–256K | 0.6 | 2.4 | — | — | 0.75 | 0.06 | 0.12 | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 1.2 | 4.8 | — | — | 1.5 | 0.12 | 0.24 | M tokens |
| Alibaba Cloud / Qwen | | 0–128K | 0.8 | 8 | — | — | 1 | 0.08 | 0.16 | M tokens |
| Alibaba Cloud / Qwen | | 128K–256K | 2.4 | 24 | — | — | 3 | 0.24 | 0.48 | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 4.8 | 64 | — | — | 6 | 0.48 | 0.96 | M tokens |
| Alibaba Cloud / Qwen | | 0–128K | 0.8 | 4.8 | — | — | 1 | 0.08 | 0.16 | M tokens |
| Alibaba Cloud / Qwen | | 128K–256K | 2 | 12 | — | — | 2.5 | 0.2 | 0.4 | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 4 | 24 | — | — | 5 | 0.4 | 0.8 | M tokens |
| Alibaba Cloud / Qwen | | 0–256K | 2 | 12 | — | — | 2.5 | 0.2 | — | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 8 | 48 | — | — | 10 | 0.8 | — | M tokens |
| Alibaba Cloud / Qwen | | 0–256K | 2 | 8 | — | — | 2.5 | 0.2 | 0.4 | M tokens |
| Alibaba Cloud / Qwen | | 256K–1M | 6 | 24 | — | — | 7.5 | 0.6 | 1.2 | M tokens |
| Alibaba Cloud / Qwen | | 不区分上下文 | 2.4 | 9.6 | — | — | — | — | 0.48 | M tokens |
| Alibaba Cloud / Qwen | | 0–32K | 2.5 | 10 | — | — | 3.125 | 0.25 | 0.5 | M tokens |
| Alibaba Cloud / Qwen | | 32K–128K | 4 | 16 | — | — | 5 | 0.4 | 0.8 | M tokens |
| Alibaba Cloud / Qwen | | 128K–256K | 7 | 28 | — | — | 8.75 | 0.7 | 1.4 | M tokens |
| Alibaba Cloud / Qwen | | 0–128K | 9 | 54 | — | — | 11.25 | 0.9 | — | M tokens |
| Alibaba Cloud / Qwen | | 128K–256K | 15 | 90 | — | — | 18.75 | 1.5 | — | M tokens |
| Alibaba Cloud / Qwen | | 0–1M | 12 | 36 | — | — | 15 | 1.2 | 2.4 | M tokens |
| Alibaba Cloud / Qwen | | 0–1M | 12 | 36 | — | — | 15 | 1 | 1.5 | — |
| ByteDance / Volcengine | | — | 3 | 9 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | [0,32] | 0.3 | 2.4 | — | — | — | — | 0.06 | M tokens |
| ByteDance / Volcengine | | (32,128] | 0.6 | 4 | — | — | — | — | 0.06 | M tokens |
| ByteDance / Volcengine | | (128,256] | 1.2 | 12 | — | — | — | — | 0.06 | M tokens |
| ByteDance / Volcengine | | [0,32] | 3.2 | 16 | — | — | — | — | 0.64 | M tokens |
| ByteDance / Volcengine | | (32,128] | 4.8 | 24 | — | — | — | — | 0.96 | M tokens |
| ByteDance / Volcengine | | (128,256] | 9.6 | 48 | — | — | — | — | 1.92 | M tokens |
| ByteDance / Volcengine | | [0,32] | 9 | 3.6 | — | — | — | — | 1.8 | M tokens |
| ByteDance / Volcengine | | (32,128] | 13.5 | 5.4 | — | — | — | — | 2.7 | M tokens |
| ByteDance / Volcengine | | (128,256] | 27 | 10.8 | — | — | — | — | 5.4 | M tokens |
| ByteDance / Volcengine | | [0,32] | 0.6 | 3.6 | — | — | — | — | 0.12 | M tokens |
| ByteDance / Volcengine | | (32,128] | 0.9 | 5.4 | — | — | — | — | 0.18 | M tokens |
| ByteDance / Volcengine | | (128,256] | 1.8 | 10.8 | — | — | — | — | 0.36 | M tokens |
| ByteDance / Volcengine | | [0,32] | 3 | 2 | — | — | — | — | 0.6 | M tokens |
| ByteDance / Volcengine | | (32,128] | 6 | 4 | — | — | — | — | 1.2 | M tokens |
| ByteDance / Volcengine | | (128,256] | 12 | 8 | — | — | — | — | 2.4 | M tokens |
| ByteDance / Volcengine | | [0,32] | 0.2 | 2 | — | — | — | — | 0.04 | M tokens |
| ByteDance / Volcengine | | (32,128] | 0.4 | 4 | — | — | — | — | 0.08 | M tokens |
| ByteDance / Volcengine | | (128,256] | 0.8 | 8 | — | — | — | — | 0.16 | M tokens |
| ByteDance / Volcengine | | [0,32] | 3.2 | 16 | — | — | — | — | 0.64 | M tokens |
| ByteDance / Volcengine | | (32,128] | 4.8 | 24 | — | — | — | — | 0.96 | M tokens |
| ByteDance / Volcengine | | (128,256] | 9.6 | 48 | — | — | — | — | 1.92 | M tokens |
| ByteDance / Volcengine | | 输入长度 [0,256] | 3 | 15 | — | — | — | — | 0.6 | M tokens |
| ByteDance / Volcengine | | 输入长度 [0,256] | 6 | 30 | — | — | — | — | 1.2 | M tokens |
| ByteDance / Volcengine | | 输入长度 [0,256] | 6 | 30 | — | — | — | — | 1.2 | M tokens |
| ByteDance / Volcengine | | [0,32] | 0.8 | 2 | — | — | — | — | 0.16 | M tokens |
| ByteDance / Volcengine | | (32,128] | 1.2 | 6 | — | — | — | — | 0.16 | M tokens |
| ByteDance / Volcengine | | — | 1.2 | 3.6 | — | — | — | — | — | M tokens |
| DeepSeek | | — | 1 | 2 | — | — | — | — | 0.2 | M tokens |
| DeepSeek | | — | 12 | 24 | — | — | — | — | 2.4 | M tokens |
| MiniMax | | — | 2.1 | 8.4 | — | — | 2.625 | 0.42 | 0.42 | M tokens |
| MiniMax | | — | 2.1 | 8.4 | — | — | 2.625 | 0.42 | 0.42 | M tokens |
| Zhipu AI | | — | 6 | 22 | — | — | — | — | 1.5 | M tokens |
| Zhipu AI | | — | 8 | 28 | — | — | 10 | 0.8 | 2 | M tokens |
| Zhipu AI | | — | 8 | 28 | — | — | 10 | 0.8 | 2 | M tokens |
| Tencent Cloud | | — | 1 | 4 | — | — | — | — | 0.25 | M tokens |
视频生成模型价格
| 厂商 | 模型名称 | 价格规格 | 输入 | 输出 | 缓存创建(5 分钟) | 缓存创建(1 小时) | 缓存创建(未分 TTL) | 缓存命中 | 隐式缓存命中 | 计费单位 |
|---|---|---|---|---|---|---|---|---|---|---|
| Alibaba Cloud | | 元/秒|1080P | — | 1.6 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|720P | — | 0.9 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|1080P | — | 1.6 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|720P | — | 0.9 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|1080P | — | 1.6 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|720P | — | 0.9 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|1080P | — | 1.6 | — | — | — | — | — | 秒 |
| Alibaba Cloud | | 元/秒|720P | — | 0.9 | — | — | — | — | — | 秒 |
| ByteDance / Volcengine | | — | — | 4.2 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | — | — | 15 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出480p/720p · 输入不含视频 | — | 37 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出480p/720p · 输入含视频 | — | 22 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出480p/720p · 输入不含视频 | — | 23 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出480p/720p · 输入含视频 | — | 14 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出480p · 输入不含视频 | — | 46 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出720p · 输入不含视频 | — | 46 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出1080p · 输入不含视频 | — | 51 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出4K · 输入不含视频 | — | 26 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出480p · 输入含视频 | — | 28 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出720p · 输入含视频 | — | 28 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出1080p · 输入含视频 | — | 31 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 输出4K · 输入含视频 | — | 16 | — | — | — | — | — | M tokens |
图片生成模型价格
| 厂商 | 模型名称 | 价格规格 | 输入 | 输出 | 缓存创建(5 分钟) | 缓存创建(1 小时) | 缓存创建(未分 TTL) | 缓存命中 | 隐式缓存命中 | 计费单位 |
|---|---|---|---|---|---|---|---|---|---|---|
| ByteDance / Volcengine | | — | — | 0.2 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | — | — | 0.25 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | — | — | 0.22 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | ≤236万像素 | 0.02 | 0.3 | — | — | — | — | — | 张 |
| ByteDance / Volcengine | | >236万像素 | 0.02 | 0.6 | — | — | — | — | — | 张 |
3D 生成模型价格
| 厂商 | 模型名称 | 价格规格 | 输入 | 输出 | 缓存创建(5 分钟) | 缓存创建(1 小时) | 缓存创建(未分 TTL) | 缓存命中 | 隐式缓存命中 | 计费单位 |
|---|---|---|---|---|---|---|---|---|---|---|
| ByteDance / Volcengine | | 带纹理和PBR材质的3D模型 | — | 80 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 标准白模 | — | 80 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 标准纹理模型 | — | 80 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 高精白模 | — | 80 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 高精纹理模型 | — | 80 | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 白模/带纹理/PBR/带纹理+PBR | — | 60 | — | — | — | — | — | M tokens |
向量模型价格
| 厂商 | 模型名称 | 价格规格 | 输入 | 输出 | 缓存创建(5 分钟) | 缓存创建(1 小时) | 缓存创建(未分 TTL) | 缓存命中 | 隐式缓存命中 | 计费单位 |
|---|---|---|---|---|---|---|---|---|---|---|
| Alibaba Cloud / Qwen | | 文本 | 0.7 | — | — | — | — | — | — | M tokens |
| Alibaba Cloud / Qwen | | 图片/视频 | 1.8 | — | — | — | — | — | — | M tokens |
| Alibaba Cloud / Qwen | | 文本 | 0.5 | — | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 图片输入 | 1.8 | — | — | — | — | — | — | M tokens |
| ByteDance / Volcengine | | 文本输入 | 0.7 | — | — | — | — | — | — | M tokens |
账单核对方法
如果需要核对费用,建议按以下步骤排查:
- 在 模型广场 中进入模型详情,确认模型标识、接入点和价格明细。
- 在 API KEY 管理 中确认该 Key 的路由策略,判断实际可能走哪个供应商或 BYOK。
- 在 用量统计 中按模型或 API Key 查看请求数、Token、系统成本和 BYOK 成本。
- 对比输入、输出、缓存、图片、视频或任务用量是否符合预期。
- 如果使用 BYOK,还需要到对应云厂商侧核对账单。
常见问题
为什么模型广场卡片价格和详情页价格不完全一致
模型卡片通常展示起步价或最低价;详情页会按接入点展示更完整的价格。接入前应以模型详情页
接入点管理 中的价格明细为准。
为什么同一模型有多个价格
同一模型可能按上下文窗口、输入类型、输出分辨率、端点、渠道或缓存命中方式分档计价。实际费用取决于当次请求命中的具体计费维度。
BYOK 是否按本文价格计费
BYOK 调用使用用户自有云厂商 Key,费用通常由用户在云厂商侧直接结算。AI Gateway 页面中的价格和成本展示可用于参考,但最终仍应以云厂商账单为准。
如何降低模型调用成本
- 优先选择符合任务复杂度的模型,不要所有场景都使用最高规格模型。
- 对重复长 Prompt、知识库上下文和 Agent 工作流使用缓存能力。
- 使用 API Key 限额和金额限额控制异常调用风险。
- 在用量统计中定期查看高消耗模型和高消耗 API Key。
- 对视频、图片、3D 等非文本模型,先确认计费单位和任务规格。
