发生了什么
OpenAI披露了GPT-Live实时语音系统的技术架构。新系统采用全双工模型,可以边听边说;较复杂的推理、搜索和工具调用则交给GPT-5.5等模型异步执行,不阻塞实时音频。
其关键设计包括:
- 将音频传输与业务逻辑拆成两条路径;
- 使用WebRTC处理低延迟媒体;
- 长对话压缩和模型实例切换在后台完成;
- 使用影子流量在真实生产环境中只读测试;
- 新WARP协议方案将媒体连接建立从六次网络往返压缩至一次。
为什么重要
语音Agent不应采用简单的:
录音 → 转文字 → LLM → 工具调用 → 生成文字 → 合成语音
这种串行架构一旦查询订单或调用业务系统较慢,用户就会长时间等待。
更合理的是:
实时语音通道:倾听、回应、保持交流
异步业务通道:查询订单、搜索资料、调用工具
控制通道:权限、审批、日志与终止
对你可能有什么用
未来开发淘宝语音客服或HMS语音录入时,可以让语音模型先说:
“我正在查询您的订单,请稍等一下。”
后台再异步调用订单系统。需要单独保存:
- 最终确认的文字记录;
- 临时语音片段与最终转写的差异;
- 工具调用结果;
- 客服或医师确认内容;
- 用户中途打断和更正的信息。
不要把实时转写的临时结果直接写入客户永久档案。