NEW
DeepSeek-V4 正式上架百万级上下文,企业级 SLA 环境下可用 Qwen3-Max 单价下调输入侧单价下调,已全量生效 企业专属实例开放预约预留算力 · 物理隔离 · 定制 SLA
查看公告

18 个已上架模型,规格与单价全部公开

其中 15 个对话与多模态模型走同一套 chat 接口,另有向量、重排、语音 3 个专用模型。切换模型只改 model 一个参数,Key、计费口径与日志格式都不用动。

18 个可调用模型 8 家模型厂商 5 类能力(含专用)
01模型清单

按能力筛选,或直接搜名字

卡片价格为每百万 Token 单价,格式为「输入 / 输出」。

DeepSeek-V4
上下文128K
¥2 / ¥8
DeepSeek-R1
上下文128K
¥4 / ¥16
Qwen3-Max
上下文256K
¥2.5 / ¥10
Qwen3-VL-32B
上下文128K
¥3 / ¥12
Qwen3-Coder-480B
上下文256K
¥4 / ¥16
Kimi-K2.7
上下文256K
¥4 / ¥16
GLM-5.3
上下文128K
¥2 / ¥8
GLM-5.3-Flash
上下文128K
¥0.5 / ¥2
MiniMax-M2.5
上下文200K
¥2.5 / ¥10
Doubao-Pro
上下文128K
¥1.6 / ¥6.4
Hunyuan-Turbo
上下文128K
¥1.5 / ¥5
ERNIE-4.5
上下文128K
¥2 / ¥8
Spark-4.0
上下文128K
¥2 / ¥8
Step-3.5-Flash
上下文64K
¥1 / ¥4
SenseNova-V6
上下文128K
¥2 / ¥8
BGE-M3
上下文8K
¥0.3
bge-reranker-v2
上下文8K
¥0.5
CosyVoice2
上下文
¥1 / 万字符
02能力对照

全量规格对照表

上下文与最大输出均为官方口径;单价为每百万 Token 的人民币价格,已含平台服务费,不再另收。

模型 厂商 类型 上下文 最大输出 输入 / 输出(每百万 Token) 典型场景
DeepSeek-V4 DeepSeek-V4 128K 64K ¥2 / ¥8
DeepSeek-R1 DeepSeek-R1 128K 32K ¥4 / ¥16
Qwen3-Max 256K 32K ¥2.5 / ¥10
Qwen3-VL-32B 128K 16K ¥3 / ¥12
Qwen3-Coder-480B 256K 32K ¥4 / ¥16
Kimi-K2.7 256K 32K ¥4 / ¥16
GLM-5.3 128K 16K ¥2 / ¥8
GLM-5.3-Flash 128K 16K ¥0.5 / ¥2
MiniMax-M2.5 MiniMax-M2.5 200K 32K ¥2.5 / ¥10
Doubao-Pro 128K 16K ¥1.6 / ¥6.4
Hunyuan-Turbo 128K 16K ¥1.5 / ¥5
ERNIE-4.5 128K 16K ¥2 / ¥8
Spark-4.0 128K 16K ¥2 / ¥8
Step-3.5-Flash 64K 8K ¥1 / ¥4
SenseNova-V6 128K 16K ¥2 / ¥8
BGE-M3 8K ¥0.3
bge-reranker-v2 8K ¥0.5
CosyVoice2 ¥1 / 万字符

本页规格与单价为设计稿示例数据,正式上架清单、上下文长度与价格以控制台模型广场及最终商务确认为准。输入侧与输出侧分开计价,输出单价通常高于输入。

03选型建议

不确定选哪个?先按这三条走

绝大多数项目不需要纠结,先按「预算优先 / 能力优先 / 检索优先」三类需求对号入座,跑通后再用真实数据换模型。

预算优先:先上轻量模型

客服问答、内容标签、结构化抽取这类任务,轻量模型完全够用。建议从 GLM-5.3-Flash、Hunyuan-Turbo、Doubao-Pro 起步,把单价压到 ¥1–2 / 百万 Token 区间,等业务跑顺再升档。

看这类模型

能力优先:长文档与复杂推理

需要跨文档比对、合同审阅、多步推导时,上下文长度和推理深度比单价重要得多。DeepSeek-V4、Qwen3-Max、Kimi-K2.7 支持 128K–256K 上下文,能一次塞进整本资料。

看长上下文模型

检索优先:向量 + 重排组合

知识库问答不要只堆大模型。先用 BGE-M3 做召回,再用 bge-reranker-v2 精排,把候选压到 5–8 条再交给生成模型,通常比直接扩大上下文更省钱也更准。

看检索类模型

拿一个 Key,把 18 个模型都试一遍

注册即赠试用额度,不需要预付、不需要签合同。跑通之后再决定要不要充值。