模型与价格
统一入口
https://api.token.heimatianqi.com/v1
一个 Key 调用所有已开放模型,切换模型只需修改 model 字段。
两个 DeepSeek 入口(V4.0 / V4.1)
平台同时提供两个明确区分的 DeepSeek 入口,model 字段不同、后端不同、计费与用量各自独立统计:
| 入口 | model 取值 |
后端 | 说明 |
|---|---|---|---|
| V4.0(本地 910B) | deepseek-v4-flash-0731 |
本机房自建推理(Ascend 910B3 × 8) | 请求与数据不出内网;无同版本备用节点,服务异常时明确报错,不会自动切到 V4.1 |
| V4.1(官方) | deepseek-v4-flash(等价写法 deepseek-flash) |
官方 DeepSeek API | 官方最新版本;可作为独立的高可用通道 |
两个入口互不顶替:
deepseek-v4-flash-0731与deepseek-v4-flash是两个不同的模型 ID, 平台不会在其中一个故障时静默切换到另一个。
推理强度(两个模型各自可调)
两个模型都通过同一个请求字段控制推理强度,互不影响:
{
"model": "deepseek-v4-flash-0731",
"messages": [{"role": "user", "content": "..."}],
"reasoning_effort": "high"
}
| 取值 | 效果 |
|---|---|
low |
最省算力(默认)。本地 V4.0 不加长思考提示;官方 V4.1 关闭长思考 |
high |
加强推理:本地 V4.0 注入「最大强度推理」提示;官方 V4.1 提升思考预算 |
max |
最强推理:本地 V4.0 注入「超最大强度」提示;官方 V4.1 以最高强度思考(等价官方 -max) |
说明:本地 V4.0 的
low / high / max由推理引擎的思考模板实现(实测输入长度 8 / 87 / 100 tokens); 官方 V4.1 的low / high / max由官方 API 的思考预算实现。两者分别调节、分别计费。 若希望用模型名表达强度,官方入口也支持deepseek-v4-flash-max、deepseek-v4-flash-none写法。
两个入口的定价(分别列出)
当前两者单价一致(可在管理后台分别调整,改价后本页与实际计费同步生效):
| 入口 | 输入 | 缓存命中 | 输出 | 高峰倍率 |
|---|---|---|---|---|
V4.0 本地 910B deepseek-v4-flash-0731 |
¥2 / 1M | ¥0.2 / 1M | ¥8 / 1M | ×1.5 |
V4.1 官方 deepseek-v4-flash / deepseek-flash |
¥2 / 1M | ¥0.2 / 1M | ¥8 / 1M | ×1.5 |
单位统一为 人民币 / 1M tokens。两个入口分别计费:调用 V4.0 的费用记在 V4.0 上, 调用 V4.1 的费用记在 V4.1 上,使用记录与余额扣减均可按模型区分。
计价维度
每个模型按三个维度计价,单位均为 ¥ / 1M tokens:
| 维度 | 说明 |
|---|---|
| Input | 输入 token |
| Cache Hit | 命中上下文缓存部分的 token(仅在供应商真实返回缓存命中时单独计价) |
| Output | 输出 token |
高峰 / 平峰
- 业务时区统一为
Asia/Shanghai - 高峰时段与倍率由平台配置(默认 09:00–12:00、14:00–18:00,倍率 1.5)
- 一次请求按请求进入平台时的价格计算:例如 11:59:59 发起、12:02 才输出完成,仍按进入时的价格计费
价格查询
控制台 →「模型与价格」;也可通过接口查询当前生效价格(管理员接口)。
缓存命中说明
部分供应商与模型不返回缓存命中 token。此时该部分按普通 Input 计价,平台会在模型说明中标注
Cache Hit Billing = Unsupported,不会伪造缓存数据。