向量与重排 embeddings / rerank
文本向量 POST /v1/embeddings
curl https://api.token.heimatianqi.com/v1/embeddings \
-H "Authorization: Bearer sk-heima-xxxxxxxx" \
-H "Content-Type: application/json" \
-d '{"model":"bge-large-zh","input":["检索增强生成是什么?"]}'
| 字段 | 说明 |
|---|---|
model |
向量模型名(以「模型与价格」里实际开放的为准) |
input |
字符串或字符串数组;数组会按元素计费 |
响应为标准 {"data":[{"embedding":[...],"index":0}],"usage":{...}},按输入 tokens 计费。
重排 POST /v1/rerank
把候选文档按与查询的相关性排序(常用于 RAG 精排):
curl https://api.token.heimatianqi.com/v1/rerank \
-H "Authorization: Bearer sk-heima-xxxxxxxx" \
-H "Content-Type: application/json" \
-d '{"model":"bge-reranker","query":"平台怎么计费?","documents":["按 tokens 计费","按次计费"]}'
该接口需要上游支持;若模型未开放重排端点,会返回明确错误而不是静默降级。
计费与注意
- 向量/重排按输入 tokens 计费,单价比对话模型低。
- 批量向量化建议分批提交(数组元素不宜过多),失败时可按批重试。
- 同一段文本重复向量化会重复计费:建议在应用侧做缓存。
常见问题
- 模型不存在:向量模型不一定在每个环境开放,请以「模型与价格」页面为准。
- 维度是多少? 由模型决定,响应里的
embedding长度即维度。