低调悄然上线,历经百天完成版本转正
近期,DeepSeek没有举办发布会,也未发布更新公告,在凌晨悄然完成V4 Pro正式版的推送,API文档内模型指纹更新为fp_v4pro_20260812,宣告这款旗舰模型结束预览阶段正式落地。从4月24日预览版对外亮相算起,整个迭代周期共计111天。
在等待正式版上线的这段周期内,行业内新品不断涌现,Kimi K3发布抢占市场焦点,V4 Flash正式版率先落地,同时API涨价预告也让广大开发者保持高度关注。在市场多方观望之下,V4 Pro正式版的低调登场,迅速在技术社区引发热烈讨论,也给国内大模型产业带来新的变量。
架构不变,后训练驱动Agent与图像能力跃升
从底层架构来看,V4 Pro正式版延续预览版1.6T总参数、49B激活参数的MoE架构,保持1M上下文、384K最大输出的硬件规格,性能提升全部来自大规模后训练优化,实际使用体验近乎全新模型。
本次升级最大的突破集中在Agent智能体赛道,多项权威基准测试实现跨越式增长。软件工程基准DeepSWE分数从12.8提升至62.7,Cybergym、Terminal Bench等测试指标同样大幅上涨,而这些评测项目,恰恰针对长链路代码修改、环境操控、工具调用等预览版薄弱环节。参考V4 Flash的迭代路径,Pro版复用面向代码Agent的训练体系,补齐了此前核心短板。
与此同时,模型摆脱纯文本局限,正式原生支持图像推理能力。DeepThink思考引擎实现图文一体化处理,可同步完成图片解析、截图识别、混合文档解读,为“看图执行任务”的Agent应用扫清基础障碍。定价层面现阶段维持原有标准,每百万token输入3元、输出6元,虽然官方已预告后续API将大幅调价,但当前版本仍处在平价调用窗口期。
实测见真章:性能亮眼,但仍存在模式特性局限
基准跑分只能作为参考,真实业务场景测试更能反映模型的实际能力。我们参考行业实测方案,从完整代码生成维度,对V4 Pro正式版开展能力验证。
在群体模拟、番茄钟工作面板两项任务中,模型表现出众。面对物理渲染与UI结合的Boids群体涌现模拟需求,模型可一次性输出完整可运行HTML代码,交互效果全部达成;面对表述模糊的番茄钟开发需求,模型能够自主完善产品逻辑,主动补充统计图表、白噪音合成等额外功能,对非标准化需求的产品化补全能力显著增强。
但测试同样暴露出产品客观特征:默认开启的thinking思考模式,会消耗大量输出token。在寻路算法可视化测试中,思考内容占用绝大多数输出配额,直接造成代码输出被截断。开发者在大段代码生成场景,需要手动关闭thinking模式或者调高token上限,以此规避内容截断问题。
性价比构筑核心优势,Agent框架开启行业新赛道
横向对比全球头部模型,V4 Pro正式版并非全方位实现碾压。在纯知识推理、超复杂软件工程任务中,对比海外头部闭源产品依旧存在小幅差距。但其核心竞争力,在于强大的综合能力与低廉调用成本的组合,同等条件下调用成本仅为海外旗舰模型的几分之一。比它性能更强的产品调用成本更高,比它价格更低的产品综合能力存在差距,这一优势在Agent落地场景中进一步放大。
更值得行业关注的是DeepSeek Harness Agent框架的相关信息。随着Harness即将发布的消息流出,大模型行业竞争逻辑正在发生改变。行业竞争不再单纯比拼模型本身的推理能力,而是转向“模型+运行框架+工具集”整套系统能力的较量。V4 Pro补齐了智能体的大脑能力,后续Harness框架的表现,将决定整套解决方案的实际落地价值。
站在数字化产业服务商视角,DeepSeek V4 Pro正式版的发布,为企业级Agent开发、代码工程、图文混合处理业务提供高性价比选型。但企业落地应用时,需要充分留意思考模式的输出特性、未来调价风险,结合业务场景做好参数调优与成本规划。大模型产业的角逐,已经从单点模型跑分,走向完整智能应用系统的比拼。