天津云数字科技有限公司项目咨询
返回公司资讯
产业新闻

LatentVerse获数亿元融资:统一触觉动作模型开辟具身智能第三条技术路线

2026年8月,具身智能赛道再迎重磅玩家。据《智能涌现》独家获悉,原生具身基座模型公司LatentVerse(潜界科技)已完成数亿元人民币种子轮融资,投资方包括高瓴创投、清流资本、智元、星动纪元及英诺天使等。这家由2001年出生的清华博士生胡钰承创立的公司,选择了一条不同于主流的技术路径——既不做VLA,也不做纯世界模型,而是将视觉语言模型与世界模型统一在同一架构中,打造"具身原生大脑"。 天津云数字科技认为,LatentVerse的技术选择反映了具身智能领域正在发生的深层路线分化。当行业普遍在VLA和世界模型两条路线上加速奔跑时,第三条统一架构路线的出现,或许代表着下一阶段的技术方向。

 

跳出VLA与世界模型之争:统一架构的技术新范式

公司资讯配图 过去两年,VLA(视觉-语言-行动)是具身智能最主流的技术路线。从RT-2到Pi-0.5,行业默认的演进逻辑是:将视觉语言模型接上动作输出,再喂入足够多的机器人操作数据,模型就能学会在物理世界中行动。但VLA有一个根本性限制——它只能利用带动作标注的数据,这些数据靠遥操作机械臂采集,一小时成本平均千元以上,还需要专业操作员,效率较低。 另一条路线是纯世界模型,通过视频生成预测未来状态再映射为动作,数据获取成本更低,互联网视频均可纳入训练。但它无法利用通用视觉语言数据,缺少VLM带来的语义理解和涌现能力——一个只会预测画面变化的模型,无法理解"把杯子递给客人"这样的指令意味着什么。 LatentVerse选择了第三条路线:把VLM和世界模型统一在同一个架构里。这一选择并非凭空而来,而是基于团队深厚的技术积累。胡钰承是最早一批证明"世界模型能直接指导机器人动作"的研究者:2024年初提出多模态扩散VLA(PAD),同年11月提出首个实现闭环推理的视频动作模型VPP,被业界称为WAM(世界动作模型)的开山之作,NVIDIA在此基础上开发了DreamZero。加入字节Seed后,他主导的BagelVLA系列发表时间甚至早于Physical Intelligence的代表性工作Pi07。 正是同时做过纯VLA和纯世界模型的经历,让团队看清了两条路线各自的天花板。要达到物理AGI终局,关键在于解决数据瓶颈——纯VLA或纯世界模型都走不到终点,需要一个将理解、预测与动作统一在同一架构中的基座模型。

UTAM四专家架构:从认知到触觉的完整执行链

公司资讯配图 LatentVerse正在训练的第一款模型名为UTAM(Unified Tactile Action Model,统一触觉动作模型),其内部包含四个专家模块,形成一条完整的执行链。 视觉语言专家负责理解任务意图;世界模型专家将从视频中学到的技能组合起来,规划新的任务流程;动作专家从前两者的推理链中生成粗粒度的动作表征,相当于"伸手去拿杯子"这样的大动作指令;最后由高频推理的触觉专家将粗动作解码为精细的末端控制信号——比如手指触碰杯壁后实时调整力度和姿态。 这一架构的精妙之处在于模拟了人类的操作逻辑:前半段开环执行(先伸手),后半段触觉闭环修正(凭手感微调)。胡钰承提出一个核心判断:"具身智能要跨越的,是认知与接触之间的最后一厘米。"机器人不能只学会看懂世界,还要学会触摸世界。 在LatentVerse的框架里,机器人进入真实场景需要同时具备两种能力:认知智能负责理解指令、规划步骤,这是VLA和世界模型已经在做的事;但光有认知不够,最后一厘米的接触信息决定了机器人能否真正完成操作——水杯外表是否光滑、柔性物体抓取时是否形变,这些信息纯靠视觉无法获取,必须通过触觉反馈实时修正。 统一架构的优势还在于数据利用效率。只要跟操作有关的视频、跨本体的机器数据、通用VLA数据,全部能纳入训练框架。当数据规模上来后,模型对场景和物体的泛化能力会显著提升,这正是纯VLA路线受限于高成本动作标注数据的痛点所在。

数据飞轮与场景落地:具身原生大脑的商业化路径

公司资讯配图 统一模型路线能跑通的前提是数据,而这也是最大的挑战。数据处理需要把长程任务拆解成若干步骤并逐步标注,比处理图片或文本复杂得多;训练需要多阶段、多任务同时进行;WAM路线依赖扩散模型,推理延时仍是尚未完全解决的工程问题。 为此,LatentVerse制定了三层数据策略:遥操数据(VR采集、带精确动作标注)只训练动作专家;人手采集数据(如第一视角)和开源视频数据训练理解与世界模型专家。在数据采集端,团队押注无本体数采路线,正在自研一款数采手套,并已与数采基地建立初步合作。目标是通过可穿戴设备让非专业人士参与数据采集,将单小时采集成本从千元级别降到百元以内。 团队的技术稀缺性还体现在开创性工作的积累上。联创张荐科是具身智能多项开创性工作的主导者——从HiRT(具身智能快慢系统,被Figure的Helix沿用)到UP-VLA(首个生成理解一体化具身模型),再到VLM4VLA,系统性证明了VLM作为具身基座的固有局限。 按规划,一个季度后LatentVerse将发布第一个参数量为16B的具身基座模型,一年到一年半内积累数十万小时训练数据。场景选择上,团队希望将触觉等复杂维度信号纳入模型,把通用性和泛化能力做出来后,覆盖更广泛的工业、商业、家用场景。 天津云数字科技认为,LatentVerse的探索代表了具身智能从"垂类可用"走向"通用泛化"的关键尝试。当前具身智能之所以只能在工业等固定场景落地,核心原因是"大脑能力不够"。只有把通用性和泛化能力做到位,机器人才有可能进入家庭这样的非结构化场景。统一架构+触觉闭环+低成本数据飞轮,这条技术路线能否跑通,将直接影响具身智能商业化的时间表。对于关注机器人产业的企业和投资者而言,LatentVerse的进展值得持续跟踪。

服务能力概览

围绕软件开发、AI系统与行业平台的常见咨询

天津云数字科技有限公司是专业软件定制开发与 AI 系统建设服务商,服务政府、企业与本地生活行业客户,承接小程序、管理系统、AI智能助手、行业平台、政企信息化和合作外包项目。

小程序与 App 开发

覆盖微信、支付宝、抖音生态,支持商城、预约、会员、门店核销与后台管理。

3万-10万起

企业管理系统开发

面向 CRM、OA、ERP、进销存、项目管理、审批流和数据报表的定制开发。

10万-50万起

AI 系统定制开发

提供 AI 客服、知识库助手、政务助手、业务问答和大模型应用集成。

50万-200万起

政企信息化与行业平台

支持多组织权限、接口集成、数据看板、国产化适配和长期运维。

200万-500万
天津云数字科技有限公司主要做什么?

天津云数字科技有限公司专注软件定制开发、小程序开发、企业管理系统、AI系统定制、行业平台和政企信息化建设。

软件开发预算一般是多少?

轻量小程序或 H5 通常 3万-10万,标准管理系统 10万-50万,行业平台或 AI 系统 50万-200万,政企级定制项目 200万-500万,实际价格根据需求复杂度、周期、数据规模、接口数量和交付标准确定。

是否支持源码交付和后续维护?

支持按合同约定交付源码、数据库结构、接口文档、部署文档、测试账号、管理员培训和售后维护建议。

服务区域只限天津吗?

公司位于天津市和平区卫津路137号,可服务天津本地客户,也支持北京、河北、华北地区及全国客户远程协作交付。

项目咨询电话:022-23214688邮箱:info@yundigi.com服务时间:早08:00至晚22:00点