AI Gateway 计费说明

本文介绍云器 AI Gateway 国内区(人民币计价)模型的计费方式、价格口径、缓存计费规则和国内模型列表价。价格用于帮助用户在接入前估算成本,实际费用请以 模型广场详情页、用量统计页面和最终账单 为准。

价格来源参考产品价格配置表与模型广场展示口径。本文仅采用国内人民币(RMB)列表价;飞书表格中的美元(USD)价格不纳入本章。模型市场价格可能随供应商、模型版本、接入点、区域和产品策略调整。

我该看哪张表

如果只想快速确认某类模型怎么计费,可以按下表选择阅读位置。

使用目标建议查看
调用 Qwen、DeepSeek、GLM、Kimi、MiniMax、豆包文本模型查看
文本模型计费
文本模型计费
和对应模型系列价格表。
想知道缓存为什么更便宜查看
Token 与缓存计费
Token 与缓存计费
使用 HappyHorse 视频模型查看
happyhorse 视频生成系列
happyhorse 视频生成系列
,该系列按秒计费。
使用豆包 Seedance 视频模型查看
豆包视频生成系列
豆包视频生成系列
,该系列按百万 Tokens 计费。
使用豆包 Seedream 图片模型查看
豆包图片生成系列
豆包图片生成系列
使用 3D 生成模型查看
豆包 3D 生成系列
豆包 3D 生成系列
使用 Embedding / 向量模型查看
向量模型价格
向量模型价格
想估算一次调用大概多少钱查看
计费示例
计费示例
想核对实际账单查看
账单核对方法
账单核对方法

价格口径

口径说明
列表价
列表价
/
刊例价
刊例价
本文列出的公开价格口径,用于成本估算和模型选型。
折后价
折后价
模型广场可能展示客户折扣后的价格,实际以页面和账单为准。
实际账单价
实际账单价
最终出账使用的价格,可能受折扣、接入点、BYOK、供应商账单周期等因素影响。
系统成本
系统成本
使用平台内置供应商产生的费用,可在用量统计中查看。
BYOK 成本
BYOK 成本
使用用户自有云厂商 Key 产生的费用,通常由用户在云厂商侧结算。

计费方式

AI Gateway 按需计费。调用模型 API 时,系统按当次实际消耗的 Tokens、时长、张数或任务量累计计费。

特性说明
按需计费
按需计费
无最低消费门槛,按实际调用量计费。
按次计量
按次计量
每次模型调用都会记录请求量、Token、计费量和成本。
按 API Key 归因
按 API Key 归因
可在用量统计中按 API Key 查看具体业务消耗。
按模型归因
按模型归因
可在用量统计中查看各模型的请求数、Token 和费用。
按月出账
按月出账
账单通常按月汇总,最终金额以账单为准。

Token 与缓存计费

文本模型 Token 计费

按 Token 计费的对话模型通常区分

输入
输入
输出
输出

字段含义
输入
输入
用户请求中 prompt、messages、上下文等输入内容的 Token 单价。
输出
输出
模型生成内容的 Token 单价。
上下文窗口
上下文窗口
部分模型按上下文窗口分段计价,长上下文可能对应更高单价。

文本模型费用通常按以下公式估算:

费用 = 输入 Token / 1,000,000 × 输入单价 + 输出 Token / 1,000,000 × 输出单价

示例:输入 1,000 tokens,输出 2,000 tokens;输入价 2 元/M Tokens,输出价 8 元/M Tokens:

1,000 / 1,000,000 × 2 + 2,000 / 1,000,000 × 8 = 0.018 元

缓存能省多少钱

如果业务反复发送相同的长系统提示词、知识库文档或固定上下文,模型可以复用已处理过的前缀内容,这就是缓存。缓存命中的单价通常低于普通输入价,因此适合长 Prompt、多轮对话和 Agent 工作流。

缓存主要分为两类:

类型工作方式价格表字段
显式缓存
显式缓存
用户或接口主动声明要缓存某段内容。首次写入可能收取写入费,后续命中按较低命中价计费。
显式·写入
显式·写入
显式·命中
显式·命中
缓存存储
缓存存储
隐式缓存
隐式缓存
系统自动识别重复前缀并复用,无需用户显式声明。
隐式·命中
隐式·命中

各列含义:

字段说明
显式·写入
显式·写入
首次把一段 Prompt 写入缓存时收取。
显式·命中
显式·命中
后续请求命中显式缓存时收取。
隐式·命中
隐式·命中
系统自动识别重复内容并命中时收取。
缓存存储
缓存存储
部分模型会对缓存内容按存储时长收取费用。

非文本模型计费

视频、图片、3D 和向量模型不一定按普通文本 Token 计费,接入前应先确认模型详情页中的计费单位。

模型类型计费说明
视频生成
视频生成
HappyHorse 系列按生成视频时长计费,单位为元/秒;豆包 Seedance 系列按百万 Tokens 计费,并按是否含视频输入、输出分辨率等维度分档。
图片生成
图片生成
豆包 Seedream 系列按百万 Tokens 计费,文生图、图生图同价。
3D 生成
3D 生成
豆包 Seed3D、Hyper3D、Hitem3D 按百万 Tokens 计费,并按白模、纹理、PBR、精度等规格分档。
多模态 Embedding
多模态 Embedding
Qwen3 VL Embedding、豆包 doubao-embedding-vision 按输入数据类型分别计价,文本输入价格低于图片 / 视频输入。

价格阅读说明

字段说明
输入 / 输出按 Token 计费的模型分别记录请求输入与模型输出的单价。
缓存创建包含 5 分钟、1 小时与未分 TTL 三类独立价格列;仅在该模型的原始价格记录有值时展示。
缓存命中读取显式缓存或命中缓存时的单价。
隐式缓存命中系统自动复用重复前缀时的单价。
价格规格上下文窗口、输入类型、分辨率、是否带视频输入等影响价格的条件。

除非表中另行标注,Token 类模型价格单位为 每百万 Tokens

表示该列未在当前工作表中配置,不表示免费或不支持该项能力。

费用估算

文本模型基础费用可按以下方式预估:

费用 = 输入 Token / 1,000,000 × 输入单价 + 输出 Token / 1,000,000 × 输出单价

若请求产生缓存创建、缓存命中或隐式缓存命中,应按表内对应列的实际用量另外计算。视频、图片、3D 与向量模型应按本页显示的时长、张数、Token 或任务规格计费。

模型价格

文本模型价格

厂商模型名称价格规格输入输出缓存创建(5 分钟)缓存创建(1 小时)缓存创建(未分 TTL)缓存命中隐式缓存命中计费单位
Alibaba Cloud / Qwen
qwen3.5-flash
qwen3.5-flash
0–128K0.220.250.02M tokens
Alibaba Cloud / Qwen
qwen3.5-flash
qwen3.5-flash
128K–256K0.8810.08M tokens
Alibaba Cloud / Qwen
qwen3.5-flash
qwen3.5-flash
256K–1M1.2121.50.12M tokens
Alibaba Cloud / Qwen
qwen3.6-flash
qwen3.6-flash
0–256K1.27.21.50.12M tokens
Alibaba Cloud / Qwen
qwen3.6-flash
qwen3.6-flash
256K–1M4.828.860.48M tokens
Alibaba Cloud / Qwen
qwen3.7-flash
qwen3.7-flash
0–32K0.20.80.240.020.04M tokens
Alibaba Cloud / Qwen
qwen3.7-flash
qwen3.7-flash
32K–256K0.62.40.750.060.12M tokens
Alibaba Cloud / Qwen
qwen3.7-flash
qwen3.7-flash
256K–1M1.24.81.50.120.24M tokens
Alibaba Cloud / Qwen
qwen-plus
qwen-plus
0–128K0.8810.080.16M tokens
Alibaba Cloud / Qwen
qwen-plus
qwen-plus
128K–256K2.42430.240.48M tokens
Alibaba Cloud / Qwen
qwen-plus
qwen-plus
256K–1M4.86460.480.96M tokens
Alibaba Cloud / Qwen
qwen3.5-plus
qwen3.5-plus
0–128K0.84.810.080.16M tokens
Alibaba Cloud / Qwen
qwen3.5-plus
qwen3.5-plus
128K–256K2122.50.20.4M tokens
Alibaba Cloud / Qwen
qwen3.5-plus
qwen3.5-plus
256K–1M42450.40.8M tokens
Alibaba Cloud / Qwen
qwen3.6-plus
qwen3.6-plus
0–256K2122.50.2M tokens
Alibaba Cloud / Qwen
qwen3.6-plus
qwen3.6-plus
256K–1M848100.8M tokens
Alibaba Cloud / Qwen
qwen3.7-plus
qwen3.7-plus
0–256K282.50.20.4M tokens
Alibaba Cloud / Qwen
qwen3.7-plus
qwen3.7-plus
256K–1M6247.50.61.2M tokens
Alibaba Cloud / Qwen
qwen-max
qwen-max
不区分上下文2.49.60.48M tokens
Alibaba Cloud / Qwen
qwen3-max
qwen3-max
0–32K2.5103.1250.250.5M tokens
Alibaba Cloud / Qwen
qwen3-max
qwen3-max
32K–128K41650.40.8M tokens
Alibaba Cloud / Qwen
qwen3-max
qwen3-max
128K–256K7288.750.71.4M tokens
Alibaba Cloud / Qwen
qwen3.6-max-preview
qwen3.6-max-preview
0–128K95411.250.9M tokens
Alibaba Cloud / Qwen
qwen3.6-max-preview
qwen3.6-max-preview
128K–256K159018.751.5M tokens
Alibaba Cloud / Qwen
qwen3.7-max
qwen3.7-max
0–1M1236151.22.4M tokens
Alibaba Cloud / Qwen
qwen3.8-max
qwen3.8-max
0–1M12361511.5
ByteDance / Volcengine
doubao-1.5-vision-pro
doubao-1.5-vision-pro
39M tokens
ByteDance / Volcengine
doubao-seed-1.6-lite
doubao-seed-1.6-lite
[0,32]0.32.40.06M tokens
ByteDance / Volcengine
doubao-seed-1.6-lite
doubao-seed-1.6-lite
(32,128]0.640.06M tokens
ByteDance / Volcengine
doubao-seed-1.6-lite
doubao-seed-1.6-lite
(128,256]1.2120.06M tokens
ByteDance / Volcengine
doubao-seed-2.0-code
doubao-seed-2.0-code
[0,32]3.2160.64M tokens
ByteDance / Volcengine
doubao-seed-2.0-code
doubao-seed-2.0-code
(32,128]4.8240.96M tokens
ByteDance / Volcengine
doubao-seed-2.0-code
doubao-seed-2.0-code
(128,256]9.6481.92M tokens
ByteDance / Volcengine
doubao-seed-2.0-lite(音频输入)
doubao-seed-2.0-lite(音频输入)
[0,32]93.61.8M tokens
ByteDance / Volcengine
doubao-seed-2.0-lite(音频输入)
doubao-seed-2.0-lite(音频输入)
(32,128]13.55.42.7M tokens
ByteDance / Volcengine
doubao-seed-2.0-lite(音频输入)
doubao-seed-2.0-lite(音频输入)
(128,256]2710.85.4M tokens
ByteDance / Volcengine
doubao-seed-2.0-lite
doubao-seed-2.0-lite
[0,32]0.63.60.12M tokens
ByteDance / Volcengine
doubao-seed-2.0-lite
doubao-seed-2.0-lite
(32,128]0.95.40.18M tokens
ByteDance / Volcengine
doubao-seed-2.0-lite
doubao-seed-2.0-lite
(128,256]1.810.80.36M tokens
ByteDance / Volcengine
doubao-seed-2.0-mini(音频输入)
doubao-seed-2.0-mini(音频输入)
[0,32]320.6M tokens
ByteDance / Volcengine
doubao-seed-2.0-mini(音频输入)
doubao-seed-2.0-mini(音频输入)
(32,128]641.2M tokens
ByteDance / Volcengine
doubao-seed-2.0-mini(音频输入)
doubao-seed-2.0-mini(音频输入)
(128,256]1282.4M tokens
ByteDance / Volcengine
doubao-seed-2.0-mini
doubao-seed-2.0-mini
[0,32]0.220.04M tokens
ByteDance / Volcengine
doubao-seed-2.0-mini
doubao-seed-2.0-mini
(32,128]0.440.08M tokens
ByteDance / Volcengine
doubao-seed-2.0-mini
doubao-seed-2.0-mini
(128,256]0.880.16M tokens
ByteDance / Volcengine
doubao-seed-2.0-pro
doubao-seed-2.0-pro
[0,32]3.2160.64M tokens
ByteDance / Volcengine
doubao-seed-2.0-pro
doubao-seed-2.0-pro
(32,128]4.8240.96M tokens
ByteDance / Volcengine
doubao-seed-2.0-pro
doubao-seed-2.0-pro
(128,256]9.6481.92M tokens
ByteDance / Volcengine
doubao-seed-2.1-turbo
doubao-seed-2.1-turbo
输入长度 [0,256]3150.6M tokens
ByteDance / Volcengine
doubao-seed-2.1-pro
doubao-seed-2.1-pro
输入长度 [0,256]6301.2M tokens
ByteDance / Volcengine
doubao-seed-evolving
doubao-seed-evolving
输入长度 [0,256]6301.2M tokens
ByteDance / Volcengine
doubao-seed-character
doubao-seed-character
[0,32]0.820.16M tokens
ByteDance / Volcengine
doubao-seed-character
doubao-seed-character
(32,128]1.260.16M tokens
ByteDance / Volcengine
doubao-seed-translation
doubao-seed-translation
1.23.6M tokens
DeepSeek
deepseek-v4-flash
deepseek-v4-flash
120.2M tokens
DeepSeek
deepseek-v4-pro
deepseek-v4-pro
12242.4M tokens
MiniMax
minimax-m2.5
minimax-m2.5
2.18.42.6250.420.42M tokens
MiniMax
minimax-m2.7
minimax-m2.7
2.18.42.6250.420.42M tokens
Zhipu AI
glm-5
glm-5
6221.5M tokens
Zhipu AI
glm-5.1
glm-5.1
828100.82M tokens
Zhipu AI
glm-5.2
glm-5.2
828100.82M tokens
Tencent Cloud
hy3
hy3
140.25M tokens

视频生成模型价格

厂商模型名称价格规格输入输出缓存创建(5 分钟)缓存创建(1 小时)缓存创建(未分 TTL)缓存命中隐式缓存命中计费单位
Alibaba Cloud
happyhorse-1.0-i2v
happyhorse-1.0-i2v
元/秒|1080P1.6
Alibaba Cloud
happyhorse-1.0-i2v
happyhorse-1.0-i2v
元/秒|720P0.9
Alibaba Cloud
happyhorse-1.0-r2v
happyhorse-1.0-r2v
元/秒|1080P1.6
Alibaba Cloud
happyhorse-1.0-r2v
happyhorse-1.0-r2v
元/秒|720P0.9
Alibaba Cloud
happyhorse-1.0-t2v
happyhorse-1.0-t2v
元/秒|1080P1.6
Alibaba Cloud
happyhorse-1.0-t2v
happyhorse-1.0-t2v
元/秒|720P0.9
Alibaba Cloud
happyhorse-1.0-video-edit
happyhorse-1.0-video-edit
元/秒|1080P1.6
Alibaba Cloud
happyhorse-1.0-video-edit
happyhorse-1.0-video-edit
元/秒|720P0.9
ByteDance / Volcengine
doubao-seedance-1.0-pro-fast
doubao-seedance-1.0-pro-fast
4.2M tokens
ByteDance / Volcengine
doubao-seedance-1.0-pro
doubao-seedance-1.0-pro
15M tokens
ByteDance / Volcengine
doubao-seedance-2.0-fast
doubao-seedance-2.0-fast
输出480p/720p · 输入不含视频37M tokens
ByteDance / Volcengine
doubao-seedance-2.0-fast
doubao-seedance-2.0-fast
输出480p/720p · 输入含视频22M tokens
ByteDance / Volcengine
doubao-seedance-2.0-mini
doubao-seedance-2.0-mini
输出480p/720p · 输入不含视频23M tokens
ByteDance / Volcengine
doubao-seedance-2.0-mini
doubao-seedance-2.0-mini
输出480p/720p · 输入含视频14M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出480p · 输入不含视频46M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出720p · 输入不含视频46M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出1080p · 输入不含视频51M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出4K · 输入不含视频26M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出480p · 输入含视频28M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出720p · 输入含视频28M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出1080p · 输入含视频31M tokens
ByteDance / Volcengine
doubao-seedance-2.0
doubao-seedance-2.0
输出4K · 输入含视频16M tokens

图片生成模型价格

厂商模型名称价格规格输入输出缓存创建(5 分钟)缓存创建(1 小时)缓存创建(未分 TTL)缓存命中隐式缓存命中计费单位
ByteDance / Volcengine
doubao-seedream-4.0
doubao-seedream-4.0
0.2M tokens
ByteDance / Volcengine
doubao-seedream-4.5
doubao-seedream-4.5
0.25M tokens
ByteDance / Volcengine
doubao-seedream-5.0-lite
doubao-seedream-5.0-lite
0.22M tokens
ByteDance / Volcengine
doubao-seedream-5.0-pro
doubao-seedream-5.0-pro
≤236万像素0.020.3
ByteDance / Volcengine
doubao-seedream-5.0-pro
doubao-seedream-5.0-pro
>236万像素0.020.6

3D 生成模型价格

厂商模型名称价格规格输入输出缓存创建(5 分钟)缓存创建(1 小时)缓存创建(未分 TTL)缓存命中隐式缓存命中计费单位
ByteDance / Volcengine
doubao-seed3d-2.0
doubao-seed3d-2.0
带纹理和PBR材质的3D模型80M tokens
ByteDance / Volcengine
hitem3d-2.0
hitem3d-2.0
标准白模80M tokens
ByteDance / Volcengine
hitem3d-2.0
hitem3d-2.0
标准纹理模型80M tokens
ByteDance / Volcengine
hitem3d-2.0
hitem3d-2.0
高精白模80M tokens
ByteDance / Volcengine
hitem3d-2.0
hitem3d-2.0
高精纹理模型80M tokens
ByteDance / Volcengine
hyper3d-gen2
hyper3d-gen2
白模/带纹理/PBR/带纹理+PBR60M tokens

向量模型价格

厂商模型名称价格规格输入输出缓存创建(5 分钟)缓存创建(1 小时)缓存创建(未分 TTL)缓存命中隐式缓存命中计费单位
Alibaba Cloud / Qwen
qwen3-vl-embedding
qwen3-vl-embedding
文本0.7M tokens
Alibaba Cloud / Qwen
qwen3-vl-embedding
qwen3-vl-embedding
图片/视频1.8M tokens
Alibaba Cloud / Qwen
text-embedding-v4
text-embedding-v4
文本0.5M tokens
ByteDance / Volcengine
doubao-embedding-vision
doubao-embedding-vision
图片输入1.8M tokens
ByteDance / Volcengine
doubao-embedding-vision
doubao-embedding-vision
文本输入0.7M tokens

账单核对方法

如果需要核对费用,建议按以下步骤排查:

  1. 模型广场 中进入模型详情,确认模型标识、接入点和价格明细。
  2. API KEY 管理 中确认该 Key 的路由策略,判断实际可能走哪个供应商或 BYOK。
  3. 用量统计 中按模型或 API Key 查看请求数、Token、系统成本和 BYOK 成本。
  4. 对比输入、输出、缓存、图片、视频或任务用量是否符合预期。
  5. 如果使用 BYOK,还需要到对应云厂商侧核对账单。

常见问题

为什么模型广场卡片价格和详情页价格不完全一致

模型卡片通常展示起步价或最低价;详情页会按接入点展示更完整的价格。接入前应以模型详情页

接入点管理
接入点管理
中的价格明细为准。

为什么同一模型有多个价格

同一模型可能按上下文窗口、输入类型、输出分辨率、端点、渠道或缓存命中方式分档计价。实际费用取决于当次请求命中的具体计费维度。

BYOK 是否按本文价格计费

BYOK 调用使用用户自有云厂商 Key,费用通常由用户在云厂商侧直接结算。AI Gateway 页面中的价格和成本展示可用于参考,但最终仍应以云厂商账单为准。

如何降低模型调用成本

  • 优先选择符合任务复杂度的模型,不要所有场景都使用最高规格模型。
  • 对重复长 Prompt、知识库上下文和 Agent 工作流使用缓存能力。
  • 使用 API Key 限额和金额限额控制异常调用风险。
  • 在用量统计中定期查看高消耗模型和高消耗 API Key。
  • 对视频、图片、3D 等非文本模型,先确认计费单位和任务规格。
联系我们
预约咨询
微信咨询
电话咨询
邮件咨询