黑马天启 · 多模型 Token 平台

向量与重排 embeddings / rerank

文本向量 POST /v1/embeddings

curl https://api.token.heimatianqi.com/v1/embeddings \
  -H "Authorization: Bearer sk-heima-xxxxxxxx" \
  -H "Content-Type: application/json" \
  -d '{"model":"bge-large-zh","input":["检索增强生成是什么?"]}'
字段 说明
model 向量模型名(以「模型与价格」里实际开放的为准)
input 字符串或字符串数组;数组会按元素计费

响应为标准 {"data":[{"embedding":[...],"index":0}],"usage":{...}},按输入 tokens 计费。

重排 POST /v1/rerank

把候选文档按与查询的相关性排序(常用于 RAG 精排):

curl https://api.token.heimatianqi.com/v1/rerank \
  -H "Authorization: Bearer sk-heima-xxxxxxxx" \
  -H "Content-Type: application/json" \
  -d '{"model":"bge-reranker","query":"平台怎么计费?","documents":["按 tokens 计费","按次计费"]}'

该接口需要上游支持;若模型未开放重排端点,会返回明确错误而不是静默降级。

计费与注意

  • 向量/重排按输入 tokens 计费,单价比对话模型低。
  • 批量向量化建议分批提交(数组元素不宜过多),失败时可按批重试。
  • 同一段文本重复向量化会重复计费:建议在应用侧做缓存。

常见问题

  • 模型不存在:向量模型不一定在每个环境开放,请以「模型与价格」页面为准。
  • 维度是多少? 由模型决定,响应里的 embedding 长度即维度。