实用指南
如何阅读一次调用的 Token、费用和 Proof
看懂输入、输出、缓存命中、费用、耗时和链路证据,判断一次模型调用是否符合预期。
Token 不是字符数
Token 是模型分词后的计费与上下文单位,不等同于中文字符、英文单词或加密后字节数。输入 Token 应以最终模型厂商或兼容上游返回的 usage 为准。
输出 Token 对应模型生成内容的分词数量。密文长度可以用于核对传输完整性,但不能代替官方 Token 用量。
缓存命中必须来自真实上游
部分厂商会在 usage 的详细字段中返回缓存命中 Token。平台应保留厂商字段映射和原始计费口径,不能根据相同 Prompt 自行推测缓存命中。
价格计算还要绑定模型、币种和价格版本。模型名称相同但接入渠道不同,成本可能并不相同。
Proof 用来回答什么
Proof 应帮助用户核对请求时间、模型、路由、状态、摘要、流式格式和解密位置,而不是保存 Prompt 和回复全文。它证明的是调用过程记录的一致性,不代表模型回答一定正确。
遇到费用或链路争议时,优先使用 request ID 对齐本地记录、平台审计和上游日志。