8 月 13 日,AI 行业上演了一场罕见的「速度对决」:谷歌正式发布 Gemini 3.7 Flash,主打编码与智能体工作流,性能全面跃升、价格直接减半;OpenAI 则携手 AI 芯片公司 Cerebras,预览了旗舰模型 GPT-5.6 Sol 的 Ultrafast 极速模式,官方称最高可提速 14 倍。两家巨头同日亮出「更快」的底牌,推理速度正成为大模型竞争的新焦点。
Gemini 3.7 Flash:三周迭代,性能价格双降
距离 Gemini 3.6 Flash 发布仅三周,谷歌便推出了 3.7 Flash,官方称其为「目前最智能的工作马模型」,面向编码与智能体场景。定价上,输入 token 每百万 0.75 美元、输出每百万 3.75 美元,约为 3.6 Flash 首发价的一半,优惠价持续到今年年底。对开发者来说,这意味着同等预算可以跑更多智能体任务,规模化部署生产级 Agent 的门槛被进一步拉低。
编码、网页与知识工作:基准全面跃升
具体数据方面:编码基准 FrontierCode 1.1 Main 得分 43.6%(上代 34.4%),DeepSWE v1.1 达 65.3%(上代 49.0%),首遍代码准确率与生产级代码生成能力均有明显进步;网页开发上,WebDev Arena Elo 1588 对 1538,能生成更完整、更贴近设计稿的界面;知识密集型场景中,GDP.pdf 基准 34.0% 对 22.0%,AutomationBench 30.4% 对 17.0%,复杂文档处理与真实业务流程完成能力近乎翻倍。谷歌表示,这些提升来自开发者反馈与算法创新,同日 Gemini Spark 也已接入新模型。
OpenAI Ultrafast:Cerebras 驱动,每秒 750 tokens
另一边,OpenAI 预览了 GPT-5.6 Sol 的 Ultrafast 模式——这是 OpenAI API 中全新的服务层级,由以晶圆级芯片闻名的 Cerebras 提供算力。OpenAI 称其速度可达标准处理的 14 倍,每秒最多输出 750 个 token,且不牺牲回答质量。Cerebras 的实测数据更有冲击力:在 Humanity's Last Exam 的 2500 道博士级题目上,Ultrafast 版用时 11 小时 11 分钟,而 Claude Fable 5 需 78 小时 27 分钟,完成同样任务的速度约为后者的 7 倍。

从「选快还是选聪明」到「每秒更多有用工作」
过去,想要实时响应,只能选用更小、更专门的模型——速度与智能是一对矛盾。OpenAI 表示 Ultrafast 指向新方向:「每秒完成更多有用的工作」。官方列举的典型场景包括故障响应、客服支持、金融市场分析与电商运营。据 TechCrunch 报道,该模式目前仅向小部分客户开放预览,OpenAI 将随算力增长逐步扩大访问范围。值得注意的是,Anthropic 的 Claude 也提供了 fast 模式,但速度不及此次发布。
为什么速度突然变得这么重要?
当模型能力趋同,推理速度与单位成本就成为产品化竞争的下一个战场。对实时客服、量化交易、代码补全这类「每秒钟都值钱」的场景,延迟直接决定体验与利润。谷歌选择「降价+提效」抢占开发者心智,OpenAI 用「极致速度」展示技术肌肉,而 Cerebras 这类专用推理芯片厂商则在背后快速卡位——三方合力,把 AI 竞争从「谁能做」推向「谁能做得又快又便宜」。
观察:AI 竞争正从「能做」转向「做得快且便宜」。Gemini 3.7 Flash 的降价让智能体规模化更现实,Cerebras 驱动的 750 tokens/秒则预示着专用推理芯片与模型厂商的合作将更加紧密。对开发者与产品经理而言,是时候把「推理速度」写进选型清单了。
参考来源
- Google Blog:Introducing Gemini 3.7 Flash(2026-08-13)
- Cerebras Blog:Accelerating GPT-5.6 Sol Ultrafast with OpenAI(2026-08-13)
- TechCrunch:OpenAI introduces 'Ultrafast',GPT-5.6 Sol 提速 14 倍(2026-08-13)
- Reuters:Google unveils Gemini 3.7 Flash AI model for coding, agent workflows
- VentureBeat:Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut
- Ars Technica / Decrypt:Google announces Gemini 3.7 Flash just three weeks after previous release;同日双发「超级快」模型报道
- 作者:lee
- 链接:https://ligan.cc/article/ai-speed-race-gemini-3-7-flash-openai-ultrafast
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。








