PRODUCT MANUAL

TokenTest Product Manual

TokenTest 是面向模型采购、中转渠道接入和生产上线前验证的黑盒评测平台。它不会存储你的 API Key,会围绕身份协议、模型能力、通道完整性、Token 计量、安全鲁棒性和稳定性给出生产参考结论。

1. How to run an evaluation / 如何使用

STEP 01填写 endpoint 与测试 Key

支持 OpenAI-compatible 或 Anthropic 风格中转。建议使用测试专用 Key。

STEP 02发现或填写模型

点击自动发现模型,或手动填入多个模型 ID,用逗号/换行分隔。

STEP 03运行并查看报告

每个模型生成摘要卡片,可展开查看每个维度、评测项和 case 证据。

建议流程:先用 1-2 个核心模型做快速验证,再对候选模型批量评测;如果要正式接入生产,把失败的 P0/P1 项逐条复核。

2. 6D evaluation dimensions / 测试维度

维度权重说明典型指标
D1 身份与协议完整性30%验证模型身份、响应协议 shape、nonce 防重放、模型列表一致性、header 溯源和鉴权兼容,是默认验真结论的核心依据。模型指纹、结构完整性、auth compatibility、signature、nonce replay。
D2 输出纪律与确定性任务30%验证严格 JSON、多约束遵循、语言格式、数学/逻辑/代码理解等可见答案稳定性;reasoning-heavy 截断会聚合为端点兼容性风险,避免重复证明“模型掺水”。JSON schema、多约束遵循、GSM8K-style、code benchmark-style、visible answer stability。
D3 通道与输出完整性5%验证工具、视觉、文档、Web Search、长输出、流式 SSE、delta 粒度、thinking 和结束信号;默认作为可选通道证据,不直接证明掺水。tool calls、vision input、document input、stream usage、finish reason。
D4 Token 计量可信度15%验证 usage 存在性、总量一致性、输入单调性、输出合理性、截断联动和 cache token 证据。input/output tokens、total consistency、stop/token limit、cache tokens。
D5 安全鲁棒性10%验证良性请求放行、Prompt 注入防护、敏感信息保护、危险代码边界、安全输出完整性和错误信息泄漏。prompt injection、secret leakage、harmful-code boundary、error response shape。
D6 稳定性、可靠性与合规10%验证端点生成截断/不可用聚合、短时延迟分布、TTFT 和成功率,为生产接入提供体验和可用性参考。endpoint generation risk、P50/P95/P99 latency、TTFT、latency sample success rate。

3. Cases and metrics / 用例与指标说明

TokenTest 的评测项由多个 case 组成。一个评测项可能包含本地严格 case、公共基准风格 case 和协议探针。报告中的每一行都会显示测试方法、判定标准、结果证据和 case 明细。

  • 结构化输出 case:要求模型只返回合法 JSON,检查字段、类型和额外文本。
  • 多约束遵循 case:同时要求语言、排序、校验和、决策字段,降低简单模板侥幸通过。
  • 数学/逻辑/代码 case:使用可确定答案的轻量题,包含 GSM8K-style 和 JavaScript pipeline 风格。
  • Token case:检查 input token 单调性、total token 一致性、max_tokens 截断和 stream usage。
  • 性能 case:短时采样计算 P50/P95/P99、TTFT 和成功率。

4. Scoring and blocking / 得分与阻断

报告会单独给出验真置信度,用于回答“是否疑似降级/掺水”;总分由 D1-D6 多维度加权和风险门控共同决定。P0 项代表生产阻断级风险,P1 项代表重要风险,P2 项代表补充观察项。

  • Production reference pass:适合作为生产接入参考,但仍建议结合业务流量灰度。
  • Needs review:关键能力或证据存在不确定,需要人工复核。
  • Blocked:存在 P0 失败、协议不可用、身份异常或严重安全/计量问题。

如果某个模型评测因为端点超时、鉴权或网络错误没有完成,页面会显示“无评分”,该行不会计入批量均分;导出的 JSON/CSV 中对应 scoreraw_score 为空,用于和低分模型区分。

5. SLA and production use / SLA 与生产接入说明

TokenTest 不替上游模型厂商或中转渠道承诺 SLA,也不会把一次短时评测等同于正式可用性担保。TokenTest 的 SLA 相关结果用于采购和上线前复核:把渠道自称的可用性、错误形态、延迟尾部和短时成功率放在同一份证据里,帮助判断是否需要灰度、降级或人工复核。

  • 供应商 SLA:如果中转商或模型供应商承诺 99.9% 等可用性,应以合同、状态页或正式服务条款为准,并单独留档。
  • TokenTest 证据:D6 会记录 P50/P95/P99、TTFT、短时成功率,以及端点生成截断或不可用聚合;这些是接入风险证据,不是长期 SLA 统计。
  • 端点不可用聚合:多个 GLM 兼容层或渠道错误(如 get_channel_failed1210)会合并为一个 P1 端点可用性风险,避免把同源端点故障重复计为多个模型能力失败。
  • 生产建议:正式接入前应用业务流量做灰度压测,设置超时、重试、备用模型和告警;TokenTest 报告适合作为上线检查和供应商沟通材料。

6. Reports and exports / 报告导出

页面报告支持折叠/展开模型详情,并提供三种导出:

  • JSON:完整机器可读结果,适合二次分析或留档。
  • CSV:按当前语言导出维度、评测项、case、判定标准和证据明细。
  • HTML:生成离线可阅读的完整模型评测报告。

7. MCP usage / MCP 使用说明

TokenTest 提供本地 stdio MCP 和远程 HTTP MCP。工具包括 discover_modelsevaluate_modelevaluate_batch

Remote MCP tools/list

curl -sS https://tokentest.io/mcp \
  -H 'Accept: application/json, text/event-stream' \
  -H 'Content-Type: application/json' \
  --data '{"jsonrpc":"2.0","id":1,"method":"tools/list","params":{}}'

evaluate_model

curl -sS https://tokentest.io/mcp \
  -H 'Accept: application/json, text/event-stream' \
  -H 'Content-Type: application/json' \
  --data '{
    "jsonrpc":"2.0",
    "id":2,
    "method":"tools/call",
    "params":{
      "name":"evaluate_model",
      "arguments":{
        "base_url":"https://your-router.example",
        "api_key":"<UPSTREAM_ROUTER_API_KEY>",
        "model":"claude-opus-4-8",
        "provider":"anthropic"
      }
    }
  }'

说明:这里的 api_key 是被测模型渠道的 Key,不是 TokenTest 账号 Key。TokenTest 不存储该 Key,远程 MCP 返回证据中会脱敏 Authorization。

8. Security notes / 安全与防滥用

  • 公开 MCP 默认启用限流:按 IP、工具类型和 batch size 控制调用。
  • 远程 MCP 默认禁止 localhost / 私网地址,降低 SSRF 风险。
  • 公开模式强制关闭 deep evaluation,避免匿名高成本评测。
  • 建议使用测试专用上游 API Key,不要使用生产主 Key。
  • 如需大规模内部评测,应使用私有 MCP_ACCESS_TOKEN 模式或专用部署。