快速开始

TokenAI 提供标准 OpenAI Chat Completions 兼容接口。三步接入:

  1. 登录控制台,创建 API Key(格式 sk-xxx
  2. 把请求地址改为 https://tokenai.biz
  3. 请求头携带 Authorization: Bearer <你的Key>

第一个请求:

curl https://tokenai.biz/v1/chat/completions \
  -H "Authorization: Bearer sk-你的Key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hy3-295b-q4-mtp",
    "messages": [{"role": "user", "content": "用一句话介绍你自己"}]
  }'

Python 示例:

import requests
resp = requests.post(
    "https://tokenai.biz/v1/chat/completions",
    headers={"Authorization": "Bearer sk-你的Key"},
    json={"model": "hy3-295b-q4-mtp",
          "messages": [{"role": "user", "content": "你好!"}]},
    timeout=60,
)
print(resp.json()["choices"][0]["message"]["content"])

接口端点

POST /v1/chat/completions

文本对话(OpenAI 兼容),支持流式与非流式。请求参数与 OpenAI 官方一致:modelmessagesstreamtemperaturemax_tokens 等。

GET /v1/models

列出当前可用的全部模型 ID。

GET /v1/dashboard/billing/subscription

OpenAI 兼容的余额查询接口(OpenCat、LobeChat 等工具会自动调用)。

请求参数

参数类型说明
modelstring必填。模型 ID,见控制台「渠道与模型」
messagesarray必填。对话消息列表(role: system / user / assistant)
streambool可选,默认 false。true 时返回 SSE 流式响应
max_tokensint可选。最大输出长度
temperaturefloat可选。采样温度,默认 1.0

流式输出(SSE)

设置 stream: true 即返回 text/event-stream,逐 token 输出,适合打字机效果。最后一个事件为 data: [DONE],部分模型会在结束前返回 usage 计费数据。

curl https://tokenai.biz/v1/chat/completions \
  -H "Authorization: Bearer sk-你的Key" \
  -N -d '{
    "model": "qwopus3.6-27b-q8-mtp",
    "messages": [{"role": "user", "content": "数到 5"}],
    "stream": true
  }'

工具接入

以下工具均支持自定义 OpenAI 兼容端点,按图配置即可:

Cursor

  • Settings → Models → OpenAI API Key:填入 sk-你的Key
  • Overrides → OpenAI Base URL:https://tokenai.biz/v1
  • 添加模型 ID 后启用即可

Cline(VS Code 插件)

  • API Provider 选择 OpenAI Compatible
  • Base URL:https://tokenai.biz/v1
  • API Key:sk-你的Key;Model ID:任意已接入模型

OpenCode / OpenCat / LobeChat

  • 新增自定义 Provider,Base URL 填 https://tokenai.biz/v1
  • API Key 填 sk-你的Key,协议选 OpenAI

Hermes Agent

# config.yaml custom_providers 示例
- name: tokenai
  base_url: https://tokenai.biz/v1
  api_key: sk-你的Key
  models:
    - hy3-295b-q4-mtp

计费说明

实际消耗 Token 数 计费(输入 + 输出分开计价),每次请求实时扣费。各模型单价见首页价格表,单位:元 / 百万 tokens

  • 余额不足时请求被拒绝(HTTP 402),充值后自动恢复
  • 用量日志记录每次调用的模型、Token、费用与耗时,可在控制台筛选查看
  • Token 计数以模型服务端上报为准,流式响应同样计入

错误码

HTTP含义处理
401API Key 无效或缺失检查请求头 Authorization
402余额不足联系管理员充值
403API Key 已被禁用联系管理员
404模型未接入检查 model 参数
429请求过于频繁稍后重试
502上游服务异常稍后重试