不同场景的RTC拓扑
AI语音典型拓扑是:

它本质上是大量一对一、持续双向的小流量会话。
模型服务器相当于通话中的另一个参与者。通信层不仅要连接用户,还要保证用户所在区域到模型部署区域之间的链路质量。
对比直播电商的典型拓扑是:

通常只有主播和少量连麦者采用RTC;绝大多数观众通过低延迟直播或CDN接收视频。
它是典型的少量上行、大规模下行分发。
社交直播的形态更多:

或者多人语音房:

它既有多人实时互动,又可能有大规模旁观用户,因此经常同时使用RTC和CDN两套网络。
各个维度的需求差异
| 维度 | AI语音 | 直播电商 | 社交直播 |
|---|---|---|---|
| 主要拓扑 | 一对一、人机双向 | 一对多、主播到观众 | 多对多与一对多混合 |
| 主要媒体 | 单路语音 | 高清视频和音频 | 语音、视频、多人连麦 |
| 带宽压力 | 低 | 极高 | 中高 |
| 延迟敏感度 | 极高 | 中等至较高 | 较高 |
| 对延迟波动的敏感度 | 极高 | 相对较低 | 较高 |
| 上行重要性 | 极高 | 主播端极高,观众端较低 | 上麦用户端较高 |
| 下行重要性 | 单路、稳定即可 | 最核心 | 取决于房间规模 |
| 主要扩容瓶颈 | 长连接数、包处理率、会话状态 | 出口带宽、转码、CDN容量 | SFU容量、音频混流、动态订阅 |
| 缓冲策略 | 尽可能浅 | 可以较深 | 互动端浅,观看端可较深 |
| 角色切换 | 很少 | 观众偶尔转为连麦者 | 非常频繁 |
| 通信控制事件 | 打断、停止播放、重连 | 开播、切流、连麦 | 上麦、下麦、禁言、跨房、合流 |
| 核心成本项 | RTC连接、服务器、跨区域链路 | 带宽、转码、CDN流量 | RTC服务器、带宽和混流 |
| CDN重要性 | 基本不需要 | 非常重要 | 大房间重要,小房间较低 |
AI语音的需求特性
不是追求最低平均延迟,而是最低“尾部延迟”
直播电商中,一部分观众偶尔多等待几百毫秒,通常不会立即破坏观看体验。
AI语音不同。即便大多数对话都很快,只要少数轮次突然停顿较久,用户就会认为AI“卡住了”或者“不知道怎么回答”。
AI语音通信层更重视:
P95、P99 网络延迟;
- 延迟抖动;
- 音频首包时间;
- 断线重连时间;
- 跨区域链路的偶发恶化;
- 端到模型服务器的完整往返时间。
传统直播系统可以依靠较深的播放缓冲吸收网络波动;AI语音不能使用同样深的缓冲,因为缓冲本身会直接增加对话等待时间。
AI语音是“低带宽、高包速率、高连接数”
单路语音占用的带宽明显低于高清视频,但音频会被切成很多连续的小数据包。
在大量AI客服或语音Agent并发时,基础设施面对的不是单纯的带宽问题。
- 大量长期在线连接;
- 大量小数据包;
- 较高的每秒数据包处理量;
- 每个会话独立的连接状态;
- NAT穿透和连接保活;
- 大量频繁的控制消息。
直播电商更偏向吞吐量问题;AI语音更偏向连接密度和数据包处理效率问题。
上行质量比直播观看场景重要得多
普通直播观众主要接收视频,上行通常只是点赞、评论等数据消息。即使观众上行网络一般,也不影响视频观看。
AI语音中,用户上行音频就是整个系统的输入。上行链路出现以下问题时,会直接破坏通信质量:
- 丢包;
- 音频断续;
- 到达顺序异常;
- 网络抖动;
- 采样率或编码格式不一致;
- 突然从Wi-Fi切换到移动网络。
支持真正的全双工通信
全双工是指用户和AI可以同时发送、接收音频。
直播电商通常以主播讲话、观众收听为主;即使连麦,也经常是有限人数参与。
AI语音默认用户可能在AI播放语音时开口。这要求通信层处理:
- AI音频播放与用户采集同时进行;
- 回声消除;
- 用户开始说话事件的快速上报;
- 立即停止下行音频;
- 清空终端播放缓冲;
- 清空媒体服务器中尚未下发的音频包;
- 通知上游停止继续发送。
播放缓冲能够快速撤销
直播视频一般追求连续播放,即使网络抖动,也倾向于增加缓冲,避免画面卡顿。
AI语音则存在相反需求:缓冲不能太深,而且可撤销。
例如AI已经生成了五秒语音,但用户听到第二秒时打断,通信层需要:
- 停止继续接收;
- 删除服务器缓存;
- 清除终端播放队列;
- 确保剩余三秒不会在稍后重新播放。
因此,AI语音的缓冲系统需要同时满足两个相互冲突的目标:
- 网络短暂抖动时保持音频连续;
- 用户插话时立即停止,不能继续“惯性播放”。
媒体格式转换更频繁
直播电商通常围绕标准视频编码建立完整链路,例如主播上行编码、云端转码、CDN分发和播放器解码。AI语音中,不同环节可能使用不同格式:
- WebRTC终端使用Opus;
- 电话网络使用窄带语音编码;
- 某些语音模型使用PCM音频;
- 不同模型要求不同采样率;
- 终端可能使用单声道或双声道;
- 模型输出和终端播放格式可能不同。
通信网关经常需要完成:
- 解码和重新编码;
- 采样率转换;
- 声道转换;
- 音频分帧;
- 协议转换;
- 时间戳重新对齐。
电话网络兼容性更加重要
大量AI语音需求来自客服、外呼、预约和销售场景,因此经常需要连接SIP和PSTN电话网络。这会带来直播电商和大多数社交直播没有的要求:
- SIP信令;
- RTP媒体流;
- 电话窄带音频;
- DTMF按键;
- 呼叫保持和转接;
- AI转人工;
- 运营商线路故障切换;
- 来电号码和线路状态管理;
- 不同国家电信网络适配。
小结
| 业务 | 通信基础设施最重要的问题 |
|---|---|
| AI语音 | 能否让大量独立双向会话始终保持低延迟、低抖动和可打断 |
| 直播电商 | 能否把高质量视频低成本、稳定地分发给大量观众 |
| 社交直播 | 能否实时管理多人、多角色、动态变化的复杂媒体关系 |