Skip to main content
AI 推理接口与普通 REST API 不同——模型生成响应需要一定的计算时间,尤其是输出内容较长或上下文较多时,单次请求耗时可能达到数十秒。如果客户端的超时配置沿用了普通接口的默认值(通常 5–10 秒),很容易在等待生成结果时触发超时中断。

常见超时原因

许多 HTTP 客户端的默认超时为 5 秒或 10 秒,这对于 AI 生成接口来说通常不够用。需要根据实际使用场景适当调大超时值。
当 messages 数组包含大量历史对话记录,或单条消息包含超长文本时,模型处理输入阶段本身就需要较多时间,进一步增加了总响应时长。建议对历史消息进行截断或摘要处理,控制每次请求的 Token 总量。
客户端到 HHAPI 服务端之间的网络延迟、DNS 解析缓慢,或服务端在高峰期的排队等待,都可能导致请求耗时增加。可参考下方网络诊断建议进行排查。

推荐超时配置

curl 超时设置

使用 curl 测试时,可通过 --max-time 参数设置最大等待时间(单位:秒):

流式请求的特殊处理

流式请求("stream": true)的超时语义与普通请求不同。连接建立后,服务端会持续推送数据块(SSE chunks)。客户端不应因为两个数据块之间的短暂间隔而触发超时断开——整体传输时长才是判断超时的依据。建议使用「连接超时」(connect timeout,如 10 秒)和「整体传输超时」(total timeout,如 120 秒)分开配置,而非使用同一个短超时值。

网络诊断建议

若频繁出现超时,可使用以下方法诊断网络层面的问题:
重点关注:
  • DNS 解析时间:解析耗时过长可能需要更换 DNS 服务器
  • TCP/TLS 握手时间:握手失败通常是网络连通性问题
  • 首字节时间(TTFB):反映服务端响应延迟
如果在排查后仍然频繁超时,请联系 技术支持 并提供请求时间、接口路径和错误信息,以便确认是否为服务端异常。

相关资源