语音 Agent 实战:实时语音 AI 架构
2026 年,「语音 Agent」从科幻变成了生产力工具——客服回电话、销售外呼、企业内部 AI 助手、车载交互、陪伴机器人,越来越多的场景开始把对话搬到语音通道。但真正做语音 Agent 的团队会发现:难点不在接入 LLM 那一段,而是围绕 ASR / LLM / TTS 三段的实时性、打断、延迟、稳定性。把 LLM API 当文本对话用谁都会,让它在双向语音流里流畅运转是另一门工程。
这篇文章梳理一条 2026 年实战可行的语音 Agent 架构,从最朴素的「三段串行」一路推到端到端实时模型,把每一层的工程要点、延迟拆解、降级与成本都摆出来。
一、架构总览:三段式 与 端到端
2026 年的两类主流实现:
- 三段式:ASR(语音转文字)→ LLM(文字生成回答)→ TTS(文字转语音)。技术成熟、模块可选、延迟优化空间大,绝大多数生产系统目前都走这条路。
- 端到端实时语音模型:模型直接吃音频流、直接吐音频流,中间不显式转文字。代表是 GPT-4o realtime、Gemini Live 等。延迟更低、天然支持打断,但生态初期、成本高、可控性弱。
选哪个?对话简单、可商用、要 1080p 稳定切片的还选三段式;做创新产品或极致交互体验可以试端到端。生产系统目前 90% 还是三段式,本文以此为主线。
二、三段式架构的核心组件
用户音频 ──→ ASR(流式) ──→ 文本 ──→ LLM(流式) ──→ 文本 token ──→ TTS(流式) ──→ 用户音频
↑ ↓
└────── 打断检测(VAD) ←──── 沉默检测 ←────┘
四个关键点:
- ASR 流式:不要等用户说完一段才转文字,边收音频边出文本增量。工业级 ASR 服务(OpenAI Whisper API、Azure Speech、阿里云语音、科大讯飞)都提供流式接口;自建可上 FunASR / Paraformer 等开源模型。
- LLM 流式:用 stream=true,openai 兼容接口都支持。LLM 的首字延迟是体验死穴,不要等 LLM 完整出完才转 TTS——见后面延迟拆解。
- TTS 流式:分句或分短语逐段合成,每段独立播放。商用 TTS(ElevenLabs、Azure、字节火山、阿里)都支持 chunked 输出。
- VAD(Voice Activity Detection):识别用户是否在说话。用于决定 ASR 何时切句、何时判定「用户说完可以回答」,以及最重要的中途打断。
三、延迟拆解:每一毫秒都要算
用户说完话到你开口回应的端到端延迟,拆成五段:
| 环节 | 典型耗时 | 优化空间 |
|---|---|---|
| ASR 末字到出全文 | 200-500ms | 用流式 ASR + VAD 精准判断句尾 |
| 请求发出 → LLM TTFT | 200-1500ms | 用更小模型、最低温度、上下文缓存 |
| LLM 首 token | 50ms | 不可避免 |
| TTS 合成首段 | 100-400ms | 短句合成(10-20 字一段) |
| 音频播放启动 | 50-100ms | 用 WebAudio / 手机原生音频 API |
典型三段式 chain 总延迟在 600ms - 2.5s 之间,端到端模型可降到 300-500ms。但3 秒就是用户的耐心临界点——超过这个时间用户会觉得「AI 在思考」,多次这样会让用户怀疑产品体验。LLM 延迟优化技巧详见《LLM API 延迟优化:从 3 秒到 300 毫秒》,三段式里最关键的也就是别让 LLM TTFT 拖太久。
四、断句与中途打断:语音 Agent 与文本 Agent 的核心差异
文本对话里用户不会「打断」AI,发完一条就完了。语音对话是双工——用户随时可能改主意、补充、改问、说「等等、换个」。中途打断是语音 Agent 体验的命门,做不好用户会觉得 AI「卡顿」或者「不灵」。
实现打断的两个层次:
- VAD 检测到用户持续说话超过 300ms → 立即停止当前 TTS 播放、丢弃 LLM 后续 token。这条规则要写得「宁愿误判断不可漏判断」。
- 新一段用户音频立即送 ASR 重新开始:把当前 LLM 状态丢弃,整个对话历史重置为「上一轮我打过断 + 用户的最新发言」。模型是无状态的,重开会话代价低,不要为了省一次循环放弃打断。
打断逻辑在客户端实现更稳——服务端发起的「停止」要通过 WebSocket 消息通知,跨网络几十毫秒延迟;客户端直接 audioPlayer.stop() 立即生效。《10 分钟给你的应用接入 AI 聊天功能》讲的是文本流式,语音流式思路类似但多了 VAD 和音频控制两端。
五、模型选型:语音路径里三层都要选对
| 组件 | 2026 主流选项 | 选型考量 |
|---|---|---|
| ASR | Whisper-large-v3 / Paraformer / Commercial APIs | 中文准确率、长音频稳定性、流式延迟 |
| LLM 对话层 | GPT-5.4-mini / DeepSeek-R1 / 本地 7B-13B | 首字快、对工具调用稳、能拿到结构化输出 |
| TTS | ElevenLabs / Azure TTS / 火山 TTS / GPT-SoVITS | 音色自然度、流式支持、定制音色 |
| VAD | Silero VAD / RNNoise / 商业 SDK 自带 | 检测精度、CPU 占用 |
对话层选型与文本场景相似但更看重延迟:mini 型号在语音对话里表现往往优于旗舰,因为旗舰推理模型的「思考时间」会拉到 10 秒以上,用户等不起。模型路由策略详见《GPT-5-mini 还是 GPT-5?》,语音场景的硬约束就一条:TTFT < 1 秒。
六、Function Calling 与工具调用:语音 Agent 也要
实时语音场景的 Function Calling 比文字难——用户听不到「我在调用查天气接口」,必须用语言告诉用户我在做什么。三种处理方式:
- 提前播报:开始调用前先生成「稍等我查一下天气」,TTS 立即合成播放,等工具返回后再补充答案。用户听觉上有「接住」的感觉。
- 静默调用:只对响应快的工具(< 500ms)用,调用中不播报,结束直接给完整答案。响应慢的工具不要静默,否则用户以为 AI 断线了。
- 不打断当前对话:工具调用结果不直接合成播放,而是作为下一句的回答内容的一部分自然带出。
Function Calling 在结构化输出场景的兼容性设计详见《LLM 结构化输出指南》。
七、端到端实时模型:2026 年的新选项
GPT-4o realtime、Gemini Live 等模型把 ASR/LLM/TTS 三段合一,直接吃音频、直接吐音频。优势:
- 延迟低:300-500ms 端到端,远好于三段式。
- 天然支持打断:模型在线处理音频流,随时吃用户的新一段。
- 情感、口音、节奏都能从语音原样吃。
但 2026 年仍然有几个问题:
- 价格贵:每分钟 $0.06-0.20,比三段式贵 2-3 倍,长对话成本明显。
- 不能精确控制:怎么让模型「用某一种音色回答」、「回答完后停 1 秒」等细节控制不如分段的 TTS 方案。
- 非英文表现不如三段式:中文、小语种场景端到端模型还赶不上「好 ASR + 好 LLM + 好 TTS」的精度组合。
选型平衡:体验为王、预算充足、英文为主的场景试端到端;成本敏感、中文密集、要求精确控制的还是三段式稳。可以走双模式:默认走三段式,特殊场景切到端到端。
八、隐私、脱敏与合规
语音场景的数据合规风险比文字更高:录音里往往带 PII(姓名、地址、身份证),还要注意对方是否知悉在被录音。
- 明示并取得同意:「为了提供 AI 服务,本通话可能被录音」类的提示不可缺。若用于训练或调优,必须有独立、明确的同意条款。
- 实时脱敏:在 ASR 输出和 LLM 输入之间加一层 PII 脱敏(手机号、身份证、银行卡替换为占位符),详见《LLM API 安全指南》合规脱敏章节。
- 录音存储:原始录音的最高安全等级要求,加密存储、访问审计、定期清理。不是技术要求是合规要求。
- 跨境数据传输:用云 ASR/TTS 时注意数据合规路径,详见《AI API SLA 谈判》。
九、成本模型:单价乘以分钟最容易超预算
语音 Agent 的成本是按「分钟」计费的,远敏感于按 token 计费的文字 Agent。一句话 30 秒phone call,成本拆分:
| 环节 | 典型单价 | 30 秒成本 |
|---|---|---|
| ASR(商用流式) | $0.006-0.024 / 分钟 | $0.003-0.012 |
| LLM(mini,500 token) | $0.0005(输入) | $0.001 |
| TTS(ElevenLabs / Azure) | $0.18-0.30 / 分钟 | $0.09-0.15 |
| 端到端实时 | $0.06-0.20 / 分钟 | $0.03-0.10 |
三段式 30 秒对话典型成本 $0.10-0.16;端到端 $0.03-0.10。但电话时长按分钟计,跑业务一天 10 万通 = $10000-16000。控制成本的关键有三点:缓存预定义答案、用更便宜的 TTS、用更便宜的 LLM。具体技巧参考《AI API 成本优化 12 招》。
十、降级链:语音场景同样要做
语音路径的灾备思路和文本场景一致——三层模块都要做降级链:
- ASR 降级:主用云 ASR,备用本地 FunASR。云服务整体不可用是低概率但确实发生过。
- LLM 降级:跨供应商、跨模型家族。详见《AI 灾备方案》。
- TTS 降级:商用 TTS 限流时切到本地 GPT-SoVITS 等开源模型,音色会掉但仍能用。
语音场景的降级链对延迟更敏感:如果某个模块降级后延迟窜到 4-5 秒,用户感知比报错更差。记住语音降级的目标:保持响应不中断,不是保持原质量。质量不会完美时及时播报「技术原因暂用替代方案」比静默降级好。
十一、上线前检查清单
- □ VAD 精度:检测「用户说完」准确率 > 90%(漏判 / 误判双向测试)
- □ 中途打断:用户开口立刻停 TTS、丢弃 LLM 后续 token
- □ P95 延迟:端到端 < 1.5 秒(三段式)或 < 0.8 秒(端到端)
- □ 降级链:三个模块各有一份可用降级
- □ 隐私合规:录音同意、PII 脱敏、跨境合规
- □ 错误回退:任何一段失败时给用户友好语音提示,不要静默
语音 Agent 是 2026 年最热的产品形态之一,但核心工程不是 LLM 而是「实时 + 稳定 + 可降级」。把这三段跑明白了再上端到端模型,会比一上来就追新模型的产品更耐打。先用 DrAI 的聚合 Key 跑通一个最小三段式 demo,详见《AI API 入门指南》。现在就注册 DrAI,把第一段三段式语音闭环跑通。
🚀 现在就体验这些模型
注册 DrAI,一个 API Key 即可调用 GPT-5 系列、Claude 4、DeepSeek R1、Gemini 2.5 Pro 等 40+ 模型,Pro 套餐仅 $9.99/月。
免费注册 → 查看定价