语音 Agent 实战:实时语音 AI 架构

2026 年,「语音 Agent」从科幻变成了生产力工具——客服回电话、销售外呼、企业内部 AI 助手、车载交互、陪伴机器人,越来越多的场景开始把对话搬到语音通道。但真正做语音 Agent 的团队会发现:难点不在接入 LLM 那一段,而是围绕 ASR / LLM / TTS 三段的实时性、打断、延迟、稳定性。把 LLM API 当文本对话用谁都会,让它在双向语音流里流畅运转是另一门工程。

这篇文章梳理一条 2026 年实战可行的语音 Agent 架构,从最朴素的「三段串行」一路推到端到端实时模型,把每一层的工程要点、延迟拆解、降级与成本都摆出来。

一、架构总览:三段式 与 端到端

2026 年的两类主流实现:

选哪个?对话简单、可商用、要 1080p 稳定切片的还选三段式;做创新产品或极致交互体验可以试端到端。生产系统目前 90% 还是三段式,本文以此为主线。

二、三段式架构的核心组件

用户音频 ──→ ASR(流式) ──→ 文本 ──→ LLM(流式) ──→ 文本 token ──→ TTS(流式) ──→ 用户音频
  ↑                                          ↓
  └────── 打断检测(VAD) ←──── 沉默检测 ←────┘

四个关键点:

  1. ASR 流式:不要等用户说完一段才转文字,边收音频边出文本增量。工业级 ASR 服务(OpenAI Whisper API、Azure Speech、阿里云语音、科大讯飞)都提供流式接口;自建可上 FunASR / Paraformer 等开源模型。
  2. LLM 流式:用 stream=true,openai 兼容接口都支持。LLM 的首字延迟是体验死穴,不要等 LLM 完整出完才转 TTS——见后面延迟拆解。
  3. TTS 流式:分句或分短语逐段合成,每段独立播放。商用 TTS(ElevenLabs、Azure、字节火山、阿里)都支持 chunked 输出。
  4. VAD(Voice Activity Detection):识别用户是否在说话。用于决定 ASR 何时切句、何时判定「用户说完可以回答」,以及最重要的中途打断

三、延迟拆解:每一毫秒都要算

用户说完话到你开口回应的端到端延迟,拆成五段:

环节典型耗时优化空间
ASR 末字到出全文200-500ms用流式 ASR + VAD 精准判断句尾
请求发出 → LLM TTFT200-1500ms用更小模型、最低温度、上下文缓存
LLM 首 token50ms不可避免
TTS 合成首段100-400ms短句合成(10-20 字一段)
音频播放启动50-100ms用 WebAudio / 手机原生音频 API

典型三段式 chain 总延迟在 600ms - 2.5s 之间,端到端模型可降到 300-500ms。但3 秒就是用户的耐心临界点——超过这个时间用户会觉得「AI 在思考」,多次这样会让用户怀疑产品体验。LLM 延迟优化技巧详见《LLM API 延迟优化:从 3 秒到 300 毫秒》,三段式里最关键的也就是别让 LLM TTFT 拖太久。

四、断句与中途打断:语音 Agent 与文本 Agent 的核心差异

文本对话里用户不会「打断」AI,发完一条就完了。语音对话是双工——用户随时可能改主意、补充、改问、说「等等、换个」。中途打断是语音 Agent 体验的命门,做不好用户会觉得 AI「卡顿」或者「不灵」。

实现打断的两个层次:

  1. VAD 检测到用户持续说话超过 300ms → 立即停止当前 TTS 播放、丢弃 LLM 后续 token。这条规则要写得「宁愿误判断不可漏判断」。
  2. 新一段用户音频立即送 ASR 重新开始:把当前 LLM 状态丢弃,整个对话历史重置为「上一轮我打过断 + 用户的最新发言」。模型是无状态的,重开会话代价低,不要为了省一次循环放弃打断。

打断逻辑在客户端实现更稳——服务端发起的「停止」要通过 WebSocket 消息通知,跨网络几十毫秒延迟;客户端直接 audioPlayer.stop() 立即生效。《10 分钟给你的应用接入 AI 聊天功能》讲的是文本流式,语音流式思路类似但多了 VAD 和音频控制两端。

五、模型选型:语音路径里三层都要选对

组件2026 主流选项选型考量
ASRWhisper-large-v3 / Paraformer / Commercial APIs中文准确率、长音频稳定性、流式延迟
LLM 对话层GPT-5.4-mini / DeepSeek-R1 / 本地 7B-13B首字快、对工具调用稳、能拿到结构化输出
TTSElevenLabs / Azure TTS / 火山 TTS / GPT-SoVITS音色自然度、流式支持、定制音色
VADSilero VAD / RNNoise / 商业 SDK 自带检测精度、CPU 占用

对话层选型与文本场景相似但更看重延迟:mini 型号在语音对话里表现往往优于旗舰,因为旗舰推理模型的「思考时间」会拉到 10 秒以上,用户等不起。模型路由策略详见《GPT-5-mini 还是 GPT-5?》,语音场景的硬约束就一条:TTFT < 1 秒。

六、Function Calling 与工具调用:语音 Agent 也要

实时语音场景的 Function Calling 比文字难——用户听不到「我在调用查天气接口」,必须用语言告诉用户我在做什么。三种处理方式:

  1. 提前播报:开始调用前先生成「稍等我查一下天气」,TTS 立即合成播放,等工具返回后再补充答案。用户听觉上有「接住」的感觉。
  2. 静默调用:只对响应快的工具(< 500ms)用,调用中不播报,结束直接给完整答案。响应慢的工具不要静默,否则用户以为 AI 断线了。
  3. 不打断当前对话:工具调用结果不直接合成播放,而是作为下一句的回答内容的一部分自然带出。

Function Calling 在结构化输出场景的兼容性设计详见《LLM 结构化输出指南》

七、端到端实时模型:2026 年的新选项

GPT-4o realtime、Gemini Live 等模型把 ASR/LLM/TTS 三段合一,直接吃音频、直接吐音频。优势:

但 2026 年仍然有几个问题:

选型平衡:体验为王、预算充足、英文为主的场景试端到端;成本敏感、中文密集、要求精确控制的还是三段式稳。可以走双模式:默认走三段式,特殊场景切到端到端。

八、隐私、脱敏与合规

语音场景的数据合规风险比文字更高:录音里往往带 PII(姓名、地址、身份证),还要注意对方是否知悉在被录音。

九、成本模型:单价乘以分钟最容易超预算

语音 Agent 的成本是按「分钟」计费的,远敏感于按 token 计费的文字 Agent。一句话 30 秒phone call,成本拆分:

环节典型单价30 秒成本
ASR(商用流式)$0.006-0.024 / 分钟$0.003-0.012
LLM(mini,500 token)$0.0005(输入)$0.001
TTS(ElevenLabs / Azure)$0.18-0.30 / 分钟$0.09-0.15
端到端实时$0.06-0.20 / 分钟$0.03-0.10

三段式 30 秒对话典型成本 $0.10-0.16;端到端 $0.03-0.10。但电话时长按分钟计,跑业务一天 10 万通 = $10000-16000。控制成本的关键有三点:缓存预定义答案、用更便宜的 TTS、用更便宜的 LLM。具体技巧参考《AI API 成本优化 12 招》

十、降级链:语音场景同样要做

语音路径的灾备思路和文本场景一致——三层模块都要做降级链:

  1. ASR 降级:主用云 ASR,备用本地 FunASR。云服务整体不可用是低概率但确实发生过。
  2. LLM 降级:跨供应商、跨模型家族。详见《AI 灾备方案》
  3. TTS 降级:商用 TTS 限流时切到本地 GPT-SoVITS 等开源模型,音色会掉但仍能用。

语音场景的降级链对延迟更敏感:如果某个模块降级后延迟窜到 4-5 秒,用户感知比报错更差。记住语音降级的目标:保持响应不中断,不是保持原质量。质量不会完美时及时播报「技术原因暂用替代方案」比静默降级好。

十一、上线前检查清单

语音 Agent 是 2026 年最热的产品形态之一,但核心工程不是 LLM 而是「实时 + 稳定 + 可降级」。把这三段跑明白了再上端到端模型,会比一上来就追新模型的产品更耐打。先用 DrAI 的聚合 Key 跑通一个最小三段式 demo,详见《AI API 入门指南》。现在就注册 DrAI,把第一段三段式语音闭环跑通。

🚀 现在就体验这些模型

注册 DrAI,一个 API Key 即可调用 GPT-5 系列、Claude 4、DeepSeek R1、Gemini 2.5 Pro 等 40+ 模型,Pro 套餐仅 $9.99/月。

免费注册 →   查看定价
🌐 中文