多维度性能全面突破,多项基准测试逼近饱和
GPT‑6 Astra在各大权威评测数据集交出断层领先的成绩单。代表陌生任务学习能力的ARC‑AGI‑3取得99.9%高分,远超人类平均48%的基准水平;高阶数学测试FrontierMath Tier 4得分97.6%,无限趋近测试集饱和阈值;漏洞利用测试ExploitBench直接拿到满分。在科学推理数据集GPQA Diamond上,即便控制算力成本,依旧实现94.9%的高分,相比前代模型实现能力与成本的双向优化。
软件工程是Astra的核心优势领域,Terminal‑Bench 4.0、DeepSWE v1.1等编程测试均刷新纪录。针对长周期工程任务,模型新增跨上下文笔记检索机制,构建外部记忆体系,不再依靠简单摘要压缩历史信息,能够留存项目全流程关键细节,对大型代码重构、多文件迭代场景带来实质性提升。同时CAD三维重建、办公文档批量生成、PPT版式继承等专业能力大幅增强,可以直接遵循企业原有格式规范输出成套业务材料,适配企业真实生产工作流。
“计算机使用”能力跃升,可直接接管完整电脑操作
相较于跑分提升,Astra最大的代际革新体现在计算机使用能力。模型可以像真人一样操作电脑,完成从PCB电路板设计、报税表单填报、PowerBI报表制作,到网站前端测试、3D场景搭建等复杂多步骤任务。OSWorld 2.0实测数据显示,相比上一代模型,单任务平均耗时缩短接近一半,任务完成率同步上涨。
Astra具备更成熟的人机协同逻辑,面对信息缺失的场景,会区分风险等级:普通细节自动补全,关键决策点主动向用户发起确认,还可以在等待用户反馈的间隙推进其他不依赖该结果的工作,大幅提升复杂任务的运行效率。科研场景中,模型不再只输出文字结论,能够直接操作专业科研软件,完成测序分析、数据可视化等实操工作,甚至推动素数间隙相关数学研究取得全新突破。
算力投入与递归训练,安全约束下有限开放
本次GPT‑6 Astra依托得州星际之门超算集群,调用超10万块GPU完成训练。训练流程出现重要变化,这是OpenAI首款将已有AI模型深度用于训练监督环节的旗舰产品,训练后期AI可自主处理大部分故障,实现递归式自我改进的初步落地,未来模型迭代速度或将不再完全受限于人力产能。
但强大能力背后伴随显著安全风险,Astra成为OpenAI内部首个达到Critical关键级网络安全阈值的模型,能够自主挖掘系统未知漏洞。出于风险管控,高阶网络安全能力暂不对外开放。上线节奏采取分级开放策略,优先面向Daybreak机构客户,后续逐步向全量商业、企业API用户铺开,API定价为输入10美元/百万Token,输出50美元/百万Token。
行业启示:大模型竞争进入智能体迭代新阶段
GPT‑6 Astra的发布,标志大模型赛道竞争从简单的跑分比拼,转向真实环境执行、长周期智能体、递归迭代能力的综合较量。过去大模型更多聚焦文本对话,而Astra把能力延伸到操作软件、处理工程、科研攻坚的真实业务场景。
对于产业从业者而言,AGI不是一夜到来的终点,而是持续演进的过程。硬件算力底座、安全对齐体系、真实场景落地能力,三者缺一不可。国内企业可以借鉴其技术演进思路,结合本土业务场景,打磨适配国内产业生态的智能体产品,挖掘大模型在企业数字化、科研生产中的落地价值。