早在今年6月,OpenAI 在首次公布 GPT-5.6 系列模型时曾透露,Sol 版本将于7月登陆 Cerebras 平台,并为部分特定客户提供高达每秒750个 token 的处理速度。然而在整个7月期间,OpenAI 并未披露关于在 Cerebras 平台上运行 Sol 推理的任何具体细节。随后,OpenAI 员工在 X 平台上证实,公司一直在与部分特定客户进行这项高速模式的内部预览。
今日,OpenAI 正式宣布推出全新的 GPT-5.6 Sol “超快(Ultrafast)”模式。该模式下,这款前沿模型的输出速度最高可达每秒750个 token。这意味着在不切换至更小或性能较低模型的前提下,其处理速度比标准模式快了最高达14倍。
这项全新的“超快”模式由 Cerebras 的晶圆级引擎(Wafer-Scale Engine)架构提供算力支持。该架构采用了 44GB 的片上静态随机存取存储器(SRAM),有效缓解了以往在基于 GPU 的系统中常会限制推理速度的数据传输瓶颈问题。

根据 Artificial Analysis 报告的输出速度数据,Cerebras 强调,GPT-5.6 Sol 超快模式的速度是 Fable 5 的11倍,且比运行在快速模式下的 Opus 4.8 快了5倍。在“人类终极考试(Humanity's Last Exam)”测试中,Sol 超快模式仅耗时11小时11分钟便处理完了全部2500道题目,而 Fable 5 则耗时78小时27分钟,且两者的准确率表现相当。
OpenAI 在其官方博客中提到,这一全新的超快模式非常适用于事件响应、金融研究、实时客户支持与语音应用、商业、编程以及研究工作流等场景。在公司内部,OpenAI 的开发人员也正利用该模式在突发事件期间分析日志和追踪记录,并以此加快研究迭代的步伐。
由于目前 Cerebras 的算力容量有限,OpenAI 将根据客户的工作负载契合度及算力可用性来评估并授予“超快”模式的访问权限。感兴趣的客户可以提交相关申请表单,以便在该模式面向大众全面开放时获得通知。
了解更多:

