1. How to run an evaluation / 如何使用
支持 OpenAI-compatible 或 Anthropic 风格中转。建议使用测试专用 Key。
点击自动发现模型,或手动填入多个模型 ID,用逗号/换行分隔。
每个模型生成摘要卡片,可展开查看每个维度、评测项和 case 证据。
建议流程:先用 1-2 个核心模型做快速验证,再对候选模型批量评测;如果要正式接入生产,把失败的 P0/P1 项逐条复核。
2. 6D evaluation dimensions / 测试维度
| 维度 | 权重 | 说明 | 典型指标 |
|---|---|---|---|
| D1 身份与协议完整性 | 30% | 验证模型身份、响应协议 shape、nonce 防重放、模型列表一致性、header 溯源和鉴权兼容,是默认验真结论的核心依据。 | 模型指纹、结构完整性、auth compatibility、signature、nonce replay。 |
| D2 输出纪律与确定性任务 | 30% | 验证严格 JSON、多约束遵循、语言格式、数学/逻辑/代码理解等可见答案稳定性;reasoning-heavy 截断会聚合为端点兼容性风险,避免重复证明“模型掺水”。 | JSON schema、多约束遵循、GSM8K-style、code benchmark-style、visible answer stability。 |
| D3 通道与输出完整性 | 5% | 验证工具、视觉、文档、Web Search、长输出、流式 SSE、delta 粒度、thinking 和结束信号;默认作为可选通道证据,不直接证明掺水。 | tool calls、vision input、document input、stream usage、finish reason。 |
| D4 Token 计量可信度 | 15% | 验证 usage 存在性、总量一致性、输入单调性、输出合理性、截断联动和 cache token 证据。 | input/output tokens、total consistency、stop/token limit、cache tokens。 |
| D5 安全鲁棒性 | 10% | 验证良性请求放行、Prompt 注入防护、敏感信息保护、危险代码边界、安全输出完整性和错误信息泄漏。 | prompt injection、secret leakage、harmful-code boundary、error response shape。 |
| D6 稳定性、可靠性与合规 | 10% | 验证端点生成截断/不可用聚合、短时延迟分布、TTFT 和成功率,为生产接入提供体验和可用性参考。 | endpoint generation risk、P50/P95/P99 latency、TTFT、latency sample success rate。 |
3. Cases and metrics / 用例与指标说明
TokenTest 的评测项由多个 case 组成。一个评测项可能包含本地严格 case、公共基准风格 case 和协议探针。报告中的每一行都会显示测试方法、判定标准、结果证据和 case 明细。
- 结构化输出 case:要求模型只返回合法 JSON,检查字段、类型和额外文本。
- 多约束遵循 case:同时要求语言、排序、校验和、决策字段,降低简单模板侥幸通过。
- 数学/逻辑/代码 case:使用可确定答案的轻量题,包含 GSM8K-style 和 JavaScript pipeline 风格。
- Token case:检查 input token 单调性、total token 一致性、max_tokens 截断和 stream usage。
- 性能 case:短时采样计算 P50/P95/P99、TTFT 和成功率。
4. Scoring and blocking / 得分与阻断
报告会单独给出验真置信度,用于回答“是否疑似降级/掺水”;总分由 D1-D6 多维度加权和风险门控共同决定。P0 项代表生产阻断级风险,P1 项代表重要风险,P2 项代表补充观察项。
- Production reference pass:适合作为生产接入参考,但仍建议结合业务流量灰度。
- Needs review:关键能力或证据存在不确定,需要人工复核。
- Blocked:存在 P0 失败、协议不可用、身份异常或严重安全/计量问题。
如果某个模型评测因为端点超时、鉴权或网络错误没有完成,页面会显示“无评分”,该行不会计入批量均分;导出的 JSON/CSV 中对应 score 和 raw_score 为空,用于和低分模型区分。
5. SLA and production use / SLA 与生产接入说明
TokenTest 不替上游模型厂商或中转渠道承诺 SLA,也不会把一次短时评测等同于正式可用性担保。TokenTest 的 SLA 相关结果用于采购和上线前复核:把渠道自称的可用性、错误形态、延迟尾部和短时成功率放在同一份证据里,帮助判断是否需要灰度、降级或人工复核。
- 供应商 SLA:如果中转商或模型供应商承诺 99.9% 等可用性,应以合同、状态页或正式服务条款为准,并单独留档。
- TokenTest 证据:D6 会记录 P50/P95/P99、TTFT、短时成功率,以及端点生成截断或不可用聚合;这些是接入风险证据,不是长期 SLA 统计。
- 端点不可用聚合:多个 GLM 兼容层或渠道错误(如
get_channel_failed、1210)会合并为一个 P1 端点可用性风险,避免把同源端点故障重复计为多个模型能力失败。 - 生产建议:正式接入前应用业务流量做灰度压测,设置超时、重试、备用模型和告警;TokenTest 报告适合作为上线检查和供应商沟通材料。
6. Reports and exports / 报告导出
页面报告支持折叠/展开模型详情,并提供三种导出:
- JSON:完整机器可读结果,适合二次分析或留档。
- CSV:按当前语言导出维度、评测项、case、判定标准和证据明细。
- HTML:生成离线可阅读的完整模型评测报告。
7. MCP usage / MCP 使用说明
TokenTest 提供本地 stdio MCP 和远程 HTTP MCP。工具包括 discover_models、evaluate_model、evaluate_batch。
Remote MCP tools/list
curl -sS https://tokentest.io/mcp \
-H 'Accept: application/json, text/event-stream' \
-H 'Content-Type: application/json' \
--data '{"jsonrpc":"2.0","id":1,"method":"tools/list","params":{}}'
evaluate_model
curl -sS https://tokentest.io/mcp \
-H 'Accept: application/json, text/event-stream' \
-H 'Content-Type: application/json' \
--data '{
"jsonrpc":"2.0",
"id":2,
"method":"tools/call",
"params":{
"name":"evaluate_model",
"arguments":{
"base_url":"https://your-router.example",
"api_key":"<UPSTREAM_ROUTER_API_KEY>",
"model":"claude-opus-4-8",
"provider":"anthropic"
}
}
}'
说明:这里的 api_key 是被测模型渠道的 Key,不是 TokenTest 账号 Key。TokenTest 不存储该 Key,远程 MCP 返回证据中会脱敏 Authorization。
8. Security notes / 安全与防滥用
- 公开 MCP 默认启用限流:按 IP、工具类型和 batch size 控制调用。
- 远程 MCP 默认禁止 localhost / 私网地址,降低 SSRF 风险。
- 公开模式强制关闭 deep evaluation,避免匿名高成本评测。
- 建议使用测试专用上游 API Key,不要使用生产主 Key。
- 如需大规模内部评测,应使用私有
MCP_ACCESS_TOKEN模式或专用部署。