玄枢API
请求耗时和延迟如何排查?
先区分连接、首 Token 与完整响应耗时,再结合模型、上下文和网络定位。
最后验证日期:
请求耗时和延迟如何排查?
先区分连接、首 Token 与完整响应耗时,再结合模型、上下文和网络定位。
操作步骤
- 记录 DNS/TLS、首字节、首 Token 和总耗时。
- 用短提示词和非流式请求建立基线。
- 对比模型、地区、并发与时间段。
限制与例外
生成长度、工具调用、上游排队和网络抖动都会影响延迟;单次结果不能代表 SLA。
玄枢API
先区分连接、首 Token 与完整响应耗时,再结合模型、上下文和网络定位。
最后验证日期:
先区分连接、首 Token 与完整响应耗时,再结合模型、上下文和网络定位。
生成长度、工具调用、上游排队和网络抖动都会影响延迟;单次结果不能代表 SLA。