TokenAI 提供标准 OpenAI Chat Completions 兼容接口。三步接入:
sk-xxx)https://tokenai.bizAuthorization: Bearer <你的Key>第一个请求:
curl https://tokenai.biz/v1/chat/completions \ -H "Authorization: Bearer sk-你的Key" \ -H "Content-Type: application/json" \ -d '{ "model": "hy3-295b-q4-mtp", "messages": [{"role": "user", "content": "用一句话介绍你自己"}] }'
Python 示例:
import requests resp = requests.post( "https://tokenai.biz/v1/chat/completions", headers={"Authorization": "Bearer sk-你的Key"}, json={"model": "hy3-295b-q4-mtp", "messages": [{"role": "user", "content": "你好!"}]}, timeout=60, ) print(resp.json()["choices"][0]["message"]["content"])
文本对话(OpenAI 兼容),支持流式与非流式。请求参数与 OpenAI 官方一致:model、messages、stream、temperature、max_tokens 等。
列出当前可用的全部模型 ID。
OpenAI 兼容的余额查询接口(OpenCat、LobeChat 等工具会自动调用)。
| 参数 | 类型 | 说明 |
|---|---|---|
model | string | 必填。模型 ID,见控制台「渠道与模型」 |
messages | array | 必填。对话消息列表(role: system / user / assistant) |
stream | bool | 可选,默认 false。true 时返回 SSE 流式响应 |
max_tokens | int | 可选。最大输出长度 |
temperature | float | 可选。采样温度,默认 1.0 |
设置 stream: true 即返回 text/event-stream,逐 token 输出,适合打字机效果。最后一个事件为 data: [DONE],部分模型会在结束前返回 usage 计费数据。
curl https://tokenai.biz/v1/chat/completions \ -H "Authorization: Bearer sk-你的Key" \ -N -d '{ "model": "qwopus3.6-27b-q8-mtp", "messages": [{"role": "user", "content": "数到 5"}], "stream": true }'
以下工具均支持自定义 OpenAI 兼容端点,按图配置即可:
sk-你的Keyhttps://tokenai.biz/v1https://tokenai.biz/v1sk-你的Key;Model ID:任意已接入模型https://tokenai.biz/v1sk-你的Key,协议选 OpenAI# config.yaml custom_providers 示例
- name: tokenai
base_url: https://tokenai.biz/v1
api_key: sk-你的Key
models:
- hy3-295b-q4-mtp
按 实际消耗 Token 数 计费(输入 + 输出分开计价),每次请求实时扣费。各模型单价见首页价格表,单位:元 / 百万 tokens。
| HTTP | 含义 | 处理 |
|---|---|---|
| 401 | API Key 无效或缺失 | 检查请求头 Authorization |
| 402 | 余额不足 | 联系管理员充值 |
| 403 | API Key 已被禁用 | 联系管理员 |
| 404 | 模型未接入 | 检查 model 参数 |
| 429 | 请求过于频繁 | 稍后重试 |
| 502 | 上游服务异常 | 稍后重试 |