完整延迟表
TTFT = 从发送请求到收到首个 token 的时间。完成时间 = 完整响应耗时(含模型生成的推理 token)。所有数值单位为毫秒,实测于 2026-08-16,按 p50 TTFT 排序。
| 模型 |
提供商 |
p50 TTFT (ms) |
p95 TTFT (ms) |
p50 完成 (ms) |
备注 |
| GPT-5-mini最快 | OpenAI | 180 | 600 | 800 | 最便宜的前沿 mini 模型;2026 年首 token 最快 |
| DeepSeek Chat快 开源 | DeepSeek | 240 | 1,100 | 1,100 | 开源权重;近零成本的对话级速度 |
| GLM-4快 开源 | 智谱 AI | 260 | 1,150 | 1,300 | 开源权重;代码能力强,TTFT 低 |
| Qwen 3.5快 开源 | 阿里云 | 280 | 1,200 | 1,400 | 开源权重;多语言支持 |
| Grok Chat Fast快 | xAI | 290 | 1,250 | 1,450 | 消费级对话;低延迟 |
| Llama 4开源 | Meta | 300 | 1,300 | 1,500 | 开源权重;输入/输出速度对称 |
| Kimi K2.6开源 | 月之暗面 | 310 | 1,350 | 1,550 | 开源权重;长上下文 |
| Claude Sonnet 4 | Anthropic | 320 | 1,400 | 1,800 | 均衡的代码与 Agent 工作负载 |
| Gemini 2.5 Pro | Google | 350 | 1,500 | 1,900 | 2M-token 上下文;多模态能力强 |
| GPT-5 | OpenAI | 420 | 1,800 | 2,100 | 前沿主力;TTFT 中游 |
| Claude Opus 4慢 | Anthropic | 680 | 3,200 | 4,500 | 深度推理;企业级工作负载 |
| DeepSeek R1慢 开源 | DeepSeek | 900 | 5,000 | 8,200 | 开放推理;设计上输出冗长的思维链 |
2026 年最快的模型
按 p50 首 token 时间排名 — 这是用户实际感知的指标。300ms 以内的模型让对话感觉瞬时响应。
⚡ 最快 Top 5(p50 TTFT)
- GPT-5-miniOpenAI · mini 档180ms
- DeepSeek ChatDeepSeek · 开源权重240ms
- GLM-4智谱 AI · 开源权重260ms
- Qwen 3.5阿里云 · 开源权重280ms
- Grok Chat FastxAI · 消费级对话290ms
📉 最低 p95 尾延迟
- GPT-5-mini最差约比 p50 慢 6 倍600ms
- DeepSeek Chatp95 vs 240ms p501,100ms
- GLM-4p50/p95 比值 4.4 倍1,150ms
- Qwen 3.5高负载下稳定1,200ms
- Grok Chat Fast对话场景尾延迟紧凑1,250ms
最慢的模型 — 以及为什么这通常不是问题
按 p50 TTFT 排名,最慢在前。高 TTFT 几乎总意味着模型在回答前做了更多工作。
🐢 最慢 Top 3(p50 TTFT)
- DeepSeek R1DeepSeek · 开放推理900ms
- Claude Opus 4Anthropic · 前沿旗舰680ms
- GPT-5OpenAI · 前沿旗舰420ms
DeepSeek R1 的 900ms 是特性,不是缺陷。推理模型会在首个可见 token 之前生成隐藏的思维链 token。R1 的 p50 完成时间 8.2s — 全表最长 — 是公开完整推理轨迹的代价。开启流式输出时,你可以逐 token 看到推理过程;感知等待时间远短于原始数字所暗示的。
延迟 vs 成本 vs 质量:真正的权衡
原始速度只是一个维度。正确的模型取决于你的请求值多少钱、难度有多大。
数据说明什么
- 快 ≠ 贵。最快的三个模型(GPT-5-mini 180ms、DeepSeek Chat 240ms、GLM-4 260ms)同时也是 模型价格指数 上最便宜的 — mini 档与开源权重模型在两个维度都胜出。
- 慢 ≠ 高端。Claude Opus 4(p50 TTFT 680ms)是市场上最贵的模型,每 1M tokens 高达 $15/$75,但它的 TTFT 比 GPT-5-mini 慢 3.8 倍。你为推理深度与输出质量付费,而非响应速度。
- 质量与完成时间相关,而非 TTFT。前沿模型把多出来的毫秒花在生成推理 token 上。在困难任务上,GPT-5 的 2.1s 完成时间几乎总是胜过 GPT-5-mini 的 800ms — 问题在于你的任务是否需要这种深度。
- 5 倍差距(180ms → 900ms p50)就是路由机会。把简单对话与自动补全路由到 300ms 以内的模型;把数学、代码审查与研究路由到推理模型。延迟感知的成本路由是 UX 与支出双赢的最大杠杆。
- p95 才是生产指标。600ms 的 p95(GPT-5-mini)意味着高负载下体验一致;DeepSeek R1 的 5,000ms p95 意味着最差情况下用户要等 5 秒才能收到首个 token — 对深度研究没问题,对聊天机器人则不可接受。
- 深入阅读:我们的工程指南 《LLM API 延迟优化》 覆盖提示词缓存、流式输出与路由策略的实践。
流式输出:为什么 180ms TTFT 感觉像瞬时
感知延迟主要取决于首 token 时间,而非总完成时间。通过逐 token 流式输出,用户在 TTFT 时就看到输出开始,然后以每秒 50–150 token 的速度跟进阅读。180ms 的 TTFT — 不到一次眨眼的四分之一 — 在用户读完刚发送的提示词之前,响应就已经开始。
数据说明什么
- 180ms + 流式 = 瞬时。GPT-5-mini 的 180ms p50 TTFT 低于人类感知 UI「即时」的约 250ms 阈值。配合流式输出,完整的 800ms 完成时间不可见 — 用户体验到的是即时回复。
- 只有关闭流式时完成时间才重要。非流式客户端要为完整 p50 完成时间付出死等:Claude Opus 4 为 4.5s,DeepSeek R1 为 8.2s。所有正经的集成都应该使用流式。
- 推理模型流式输出思维过程。DeepSeek R1 的 8.2s 完成时间体验为实时推理轨迹 — 用户看着模型「思考」,这读起来是投入,而非缓慢。
- 尾延迟在规模下会叠加。突发负载下 5,000ms 的 p95(DeepSeek R1)不流式可能变成 10 秒以上的超时;流式把最坏情况的等待转化为可见的进度。
- 按体验路由:自动补全与对话用 p50 低于 300ms 的模型;交互工具用 p95 低于 1,500ms 的模型;批处理与后台任务则任何模型都可以。
数据集说明与方法论
这个基准是如何构建的
- 范围:8 家提供商的 12 个模型 — OpenAI、Anthropic、DeepSeek、Google、Meta、阿里云、月之暗面、智谱 AI、xAI。
- 指标:TTFT = 从发送请求到收到首个 token 的时间。完成时间 = 完整响应耗时,含生成的推理 token。
- 测量:在相同硬件、开启流式、单一区域下,对采样请求组合取 p50 与 p95。提供商负载与网络地理会改变绝对值;相对排序是稳定的。
- 频率:每周刷新;最后核验 2026-08-16。
- 成本对照:参见 模型价格指数 查看同批模型每 1M tokens 的美元价格。
- 关于 DrAI:DrAI 以统一订阅价格提供上述全部模型 — 无按 token 计量、无意外账单,且每个模型都是同一套流式 API。参见 定价。
以上所有模型。一个统一价格。
不再计量 token、不再盯延迟。DrAI 将 GPT-5、Claude Opus 4、DeepSeek R1 及 12+ 个模型打包进一个订阅,统一流式 API。
查看 DrAI 定价
免费开始 — 无需信用卡