黑马天启 · 多模型 Token 平台

模型与价格

统一入口

https://api.token.heimatianqi.com/v1

一个 Key 调用所有已开放模型,切换模型只需修改 model 字段。

两个 DeepSeek 入口(V4.0 / V4.1)

平台同时提供两个明确区分的 DeepSeek 入口,model 字段不同、后端不同、计费与用量各自独立统计:

入口 model 取值 后端 说明
V4.0(本地 910B) deepseek-v4-flash-0731 本机房自建推理(Ascend 910B3 × 8) 请求与数据不出内网;无同版本备用节点,服务异常时明确报错,不会自动切到 V4.1
V4.1(官方) deepseek-v4-flash(等价写法 deepseek-flash) 官方 DeepSeek API 官方最新版本;可作为独立的高可用通道

两个入口互不顶替:deepseek-v4-flash-0731 与 deepseek-v4-flash 是两个不同的模型 ID, 平台不会在其中一个故障时静默切换到另一个。

推理强度(两个模型各自可调)

两个模型都通过同一个请求字段控制推理强度,互不影响:

{
  "model": "deepseek-v4-flash-0731",
  "messages": [{"role": "user", "content": "..."}],
  "reasoning_effort": "high"
}
取值 效果
low 最省算力(默认)。本地 V4.0 不加长思考提示;官方 V4.1 关闭长思考
high 加强推理:本地 V4.0 注入「最大强度推理」提示;官方 V4.1 提升思考预算
max 最强推理:本地 V4.0 注入「超最大强度」提示;官方 V4.1 以最高强度思考(等价官方 -max)

说明:本地 V4.0 的 low / high / max 由推理引擎的思考模板实现(实测输入长度 8 / 87 / 100 tokens); 官方 V4.1 的 low / high / max 由官方 API 的思考预算实现。两者分别调节、分别计费。 若希望用模型名表达强度,官方入口也支持 deepseek-v4-flash-max、deepseek-v4-flash-none 写法。

两个入口的定价(分别列出)

当前两者单价一致(可在管理后台分别调整,改价后本页与实际计费同步生效):

入口 输入 缓存命中 输出 高峰倍率
V4.0 本地 910B deepseek-v4-flash-0731 ¥2 / 1M ¥0.2 / 1M ¥8 / 1M ×1.5
V4.1 官方 deepseek-v4-flash / deepseek-flash ¥2 / 1M ¥0.2 / 1M ¥8 / 1M ×1.5

单位统一为 人民币 / 1M tokens。两个入口分别计费:调用 V4.0 的费用记在 V4.0 上, 调用 V4.1 的费用记在 V4.1 上,使用记录与余额扣减均可按模型区分。

计价维度

每个模型按三个维度计价,单位均为 ¥ / 1M tokens:

维度 说明
Input 输入 token
Cache Hit 命中上下文缓存部分的 token(仅在供应商真实返回缓存命中时单独计价)
Output 输出 token

高峰 / 平峰

  • 业务时区统一为 Asia/Shanghai
  • 高峰时段与倍率由平台配置(默认 09:00–12:00、14:00–18:00,倍率 1.5)
  • 一次请求按请求进入平台时的价格计算:例如 11:59:59 发起、12:02 才输出完成,仍按进入时的价格计费

价格查询

控制台 →「模型与价格」;也可通过接口查询当前生效价格(管理员接口)。

缓存命中说明

部分供应商与模型不返回缓存命中 token。此时该部分按普通 Input 计价,平台会在模型说明中标注 Cache Hit Billing = Unsupported,不会伪造缓存数据。