Skip to main content
GET
模型价格接口
qwen3.8-max 为例说明;data.pricing 的结构对所有走 TokenPricingV2 的模型通用。
完整模型能力与计费口径见 qwen3.8-max 接入指南
本接口无需鉴权,不必传 Authorization

请求参数

string
必填
模型 ID,例如 qwen3.8-max。必填;不传会返回 400 Missing model parameter

只读 data.pricing

响应里可能有多个价格相关块,前端只应读 data.pricing token_price 可能缺少 explicit_cached_input 等字段,按它估价会偏高。新计费维度只会进入 pricing 示例对比:

rateseffective_rates

展示价直接用 effective_rates,不要自己再乘。 需要同时显示划线价时再用 rates
group 常为 default:价格页面向访客统一按 default 报价。用户真实扣费按其所属分组,可能低于展示价
rates / effective_ratesunit 一般为 usd_per_million_tokens(每百万 token 美元价)。

工具价:extras.tools 只有原价

这是当前接口的不对称点:
unit 换算,不要写死「每千次」

字段缺省的三态语义

示例:
  • output_thinking 不出现 → 只有一个输出价,不要渲染成「思考免费」。qwen3.8-max 思考不可关,官方只公布一个输出价。
  • extras.google_web_search 不出现 → Vertex 专有字段;百炼类搜索在 extras.tools.web_search
  • extras.tools 里某工具 price: 0显式免费(如限时免费),如实展示。

是否多档:只看 tier_count

阶梯语义:按单次请求输入 token 总量选一档,整请求按该档单价结算(不累进)。tiers 内是原价,乘 price_factor 得实付。
billing_type === "tiered_token" 不能用来判断是否多档——单档模型也可能是这个值。只看 tier_count

limits(与单价无关)

  • supports_cache_read / supports_cache_write:是否支持缓存能力;为 false 时即使 rates 有缓存价也不应展示为可用。
  • max_output_tokens:请求未传 max_tokens 时的预扣上限参考,不是价格。

TypeScript 类型(可直接用)

工具价渲染示例

常见错法

请求示例