数据 · 更新于 2026-08-16

AI 模型延迟基准 2026:首 token 时间对比

8 家提供商 12 个 AI 模型的首 token 时间(TTFT)— 从 GPT-5-mini 的 180ms p50 到 DeepSeek R1 的 900ms。在相同硬件上开启流式输出实测,每周更新。

最后核验 2026-08-16 · 12 个模型 · 8 家提供商
💰 在价格指数上对比模型成本 →
180ms
最快 p50 TTFT
900ms
最慢 p50 TTFT
5.0×
最快→最慢差距
12
追踪模型数

完整延迟表

TTFT = 从发送请求到收到首个 token 的时间。完成时间 = 完整响应耗时(含模型生成的推理 token)。所有数值单位为毫秒,实测于 2026-08-16,按 p50 TTFT 排序。

模型 提供商 p50 TTFT (ms) p95 TTFT (ms) p50 完成 (ms) 备注
GPT-5-mini最快OpenAI180600800最便宜的前沿 mini 模型;2026 年首 token 最快
DeepSeek Chat 开源DeepSeek2401,1001,100开源权重;近零成本的对话级速度
GLM-4 开源智谱 AI2601,1501,300开源权重;代码能力强,TTFT 低
Qwen 3.5 开源阿里云2801,2001,400开源权重;多语言支持
Grok Chat FastxAI2901,2501,450消费级对话;低延迟
Llama 4开源Meta3001,3001,500开源权重;输入/输出速度对称
Kimi K2.6开源月之暗面3101,3501,550开源权重;长上下文
Claude Sonnet 4Anthropic3201,4001,800均衡的代码与 Agent 工作负载
Gemini 2.5 ProGoogle3501,5001,9002M-token 上下文;多模态能力强
GPT-5OpenAI4201,8002,100前沿主力;TTFT 中游
Claude Opus 4Anthropic6803,2004,500深度推理;企业级工作负载
DeepSeek R1 开源DeepSeek9005,0008,200开放推理;设计上输出冗长的思维链

2026 年最快的模型

按 p50 首 token 时间排名 — 这是用户实际感知的指标。300ms 以内的模型让对话感觉瞬时响应。

⚡ 最快 Top 5(p50 TTFT)

  1. GPT-5-miniOpenAI · mini 档180ms
  2. DeepSeek ChatDeepSeek · 开源权重240ms
  3. GLM-4智谱 AI · 开源权重260ms
  4. Qwen 3.5阿里云 · 开源权重280ms
  5. Grok Chat FastxAI · 消费级对话290ms

📉 最低 p95 尾延迟

  1. GPT-5-mini最差约比 p50 慢 6 倍600ms
  2. DeepSeek Chatp95 vs 240ms p501,100ms
  3. GLM-4p50/p95 比值 4.4 倍1,150ms
  4. Qwen 3.5高负载下稳定1,200ms
  5. Grok Chat Fast对话场景尾延迟紧凑1,250ms

最慢的模型 — 以及为什么这通常不是问题

按 p50 TTFT 排名,最慢在前。高 TTFT 几乎总意味着模型在回答前做了更多工作。

🐢 最慢 Top 3(p50 TTFT)

  1. DeepSeek R1DeepSeek · 开放推理900ms
  2. Claude Opus 4Anthropic · 前沿旗舰680ms
  3. GPT-5OpenAI · 前沿旗舰420ms
DeepSeek R1 的 900ms 是特性,不是缺陷。推理模型会在首个可见 token 之前生成隐藏的思维链 token。R1 的 p50 完成时间 8.2s — 全表最长 — 是公开完整推理轨迹的代价。开启流式输出时,你可以逐 token 看到推理过程;感知等待时间远短于原始数字所暗示的。

延迟 vs 成本 vs 质量:真正的权衡

原始速度只是一个维度。正确的模型取决于你的请求值多少钱、难度有多大。

数据说明什么

  • 快 ≠ 贵。最快的三个模型(GPT-5-mini 180ms、DeepSeek Chat 240ms、GLM-4 260ms)同时也是 模型价格指数 上最便宜的 — mini 档与开源权重模型在两个维度都胜出。
  • 慢 ≠ 高端。Claude Opus 4(p50 TTFT 680ms)是市场上最贵的模型,每 1M tokens 高达 $15/$75,但它的 TTFT 比 GPT-5-mini 慢 3.8 倍。你为推理深度与输出质量付费,而非响应速度。
  • 质量与完成时间相关,而非 TTFT。前沿模型把多出来的毫秒花在生成推理 token 上。在困难任务上,GPT-5 的 2.1s 完成时间几乎总是胜过 GPT-5-mini 的 800ms — 问题在于你的任务是否需要这种深度。
  • 5 倍差距(180ms → 900ms p50)就是路由机会。把简单对话与自动补全路由到 300ms 以内的模型;把数学、代码审查与研究路由到推理模型。延迟感知的成本路由是 UX 与支出双赢的最大杠杆。
  • p95 才是生产指标。600ms 的 p95(GPT-5-mini)意味着高负载下体验一致;DeepSeek R1 的 5,000ms p95 意味着最差情况下用户要等 5 秒才能收到首个 token — 对深度研究没问题,对聊天机器人则不可接受。
  • 深入阅读:我们的工程指南 《LLM API 延迟优化》 覆盖提示词缓存、流式输出与路由策略的实践。

流式输出:为什么 180ms TTFT 感觉像瞬时

感知延迟主要取决于首 token 时间,而非总完成时间。通过逐 token 流式输出,用户在 TTFT 时就看到输出开始,然后以每秒 50–150 token 的速度跟进阅读。180ms 的 TTFT — 不到一次眨眼的四分之一 — 在用户读完刚发送的提示词之前,响应就已经开始。

数据说明什么

  • 180ms + 流式 = 瞬时。GPT-5-mini 的 180ms p50 TTFT 低于人类感知 UI「即时」的约 250ms 阈值。配合流式输出,完整的 800ms 完成时间不可见 — 用户体验到的是即时回复。
  • 只有关闭流式时完成时间才重要。非流式客户端要为完整 p50 完成时间付出死等:Claude Opus 4 为 4.5s,DeepSeek R1 为 8.2s。所有正经的集成都应该使用流式。
  • 推理模型流式输出思维过程。DeepSeek R1 的 8.2s 完成时间体验为实时推理轨迹 — 用户看着模型「思考」,这读起来是投入,而非缓慢。
  • 尾延迟在规模下会叠加。突发负载下 5,000ms 的 p95(DeepSeek R1)不流式可能变成 10 秒以上的超时;流式把最坏情况的等待转化为可见的进度。
  • 按体验路由:自动补全与对话用 p50 低于 300ms 的模型;交互工具用 p95 低于 1,500ms 的模型;批处理与后台任务则任何模型都可以。

数据集说明与方法论

这个基准是如何构建的

  • 范围:8 家提供商的 12 个模型 — OpenAI、Anthropic、DeepSeek、Google、Meta、阿里云、月之暗面、智谱 AI、xAI。
  • 指标:TTFT = 从发送请求到收到首个 token 的时间。完成时间 = 完整响应耗时,含生成的推理 token。
  • 测量:在相同硬件、开启流式、单一区域下,对采样请求组合取 p50 与 p95。提供商负载与网络地理会改变绝对值;相对排序是稳定的。
  • 频率:每周刷新;最后核验 2026-08-16。
  • 成本对照:参见 模型价格指数 查看同批模型每 1M tokens 的美元价格。
  • 关于 DrAI:DrAI 以统一订阅价格提供上述全部模型 — 无按 token 计量、无意外账单,且每个模型都是同一套流式 API。参见 定价

以上所有模型。一个统一价格。

不再计量 token、不再盯延迟。DrAI 将 GPT-5、Claude Opus 4、DeepSeek R1 及 12+ 个模型打包进一个订阅,统一流式 API。

查看 DrAI 定价 免费开始 — 无需信用卡
🌐 English