近日,具身基座模型公司LatentVerse(潜界科技)宣布完成数亿元种子轮融资。投资方包括高瓴创投、清流资本、英诺基金等美元机构、产业基金智元及星动纪元。
LatentVerse 成立于 2026 年 5 月,由来自清华大学交叉信息研究院的具身智能研究团队创立,成员来自清华大学、南洋理工大学、北京大学,以及字节跳动 Seed、阿里巴巴 Qwen、小米等大模型与具身智能团队。
公司核心成员是 00 后博士生,团队人才密度极高,其研究方向覆盖具身模型预训练、世界模型、灵巧操作、数据基础设施与端侧部署。团队研究主线与具身智能模型范式演进高度一致。成员过往工作包括:
· VA(视觉-动作)阶段,团队成员提出 DP3,这是 3D 具身策略学习领域最具影响力的工作之一。
· VLA(视觉-语言-动作模型)成为主流范式后,团队成员提出 HiRT,这项工作被全球头部具身智能公司 Figure AI 的人形机器人大模型 Helix 沿用。
· 提出 VPP,这项工作被英伟达 DreamZero,Lingbot-VA 等世界动作模型项目引用。英伟达机器人主管 Jim Fan 因此发出合作邀请。
· Unified Model(统一模型)阶段,团队持续探索 VLA 与 WAM(世界动作模型)统一,同时开展 RDP(核心思路被英伟达 T-Rex 延续)和灵巧手通用大模型 UniDex 等工作。
· 今年,团队参与提出 BagelVLA和UAM,让机器人先在视觉上预测执行后世界会变成什么样,再生成动作。
LatentVerse 创始人兼 CEO 胡钰承是清华大学交叉信息研究院博士,师从叉院助理教授、星动纪元创始人陈建宇,曾在字节跳动 Seed 参与具身智能基座模型研究。他是第一个提出VLA 和 WAM 融合架构的具身研究者。
沿着 VA、VLA、WAM 到 Unified Model 的演进路径,LatentVerse 形成 UTAM(Unified Tactile Action Model)具身全模态世界模型。本轮融资将主要用于该模型研发、多模态具身数据体系、模型训练基础设施,以及机器人在真实场景中的技术验证。
机器人商业化需要同时跨过认知和接触两道门槛
具身智能经历过去几年的发展,已经能够完成抓取、放置、折叠等单项任务,但真实商业环境中的机器人往往需要面对物体变化、环境变化、连续步骤和复杂接触。如何让机器人利用预训练基座模型能力实现跨场景、跨本体和通用技能的泛化,是未来具身智能从实验室、发Demo走向规模化商用的核心瓶颈。
LatentVerse认为,让机器人真正完全复刻人类的各项技能需要模型同时具备认知智能与接触智能。
认知智能可以类比人类的高层行为模式,机器人不仅需要听懂、模仿简单的任务,更需要利用大脑理解新指令,适应环境变化并重新调用和组合已有技能,完成新的任务流程。现有VLA与WAM分别在语义理解、动作生成和未来状态预测方面取得了进展,但如何在长时任务中完成稳定的技能组合与动态规划,仍是具身模型面临的重要挑战。
接触智能则决定了智能体能否解决通用场景的"最后一厘米"问题。真实的家庭场景中,仅有视觉语言的认知远远不够,水杯外表是否光滑、柔性物体是否产生形变,剪刀等人类工具抓握姿态是否正确,这些接触信息决定了智能体能否充分获取现实世界的物理信号。触觉信息需要融合认知系统产生相应的反馈,才能真正解决通用场景的最后一公里问题。
在 LatentVerse 看来,高层认知和触觉反射并不是具身智能的两个单独的系统,而是应该相互融合建立起机器人对真实世界的完备感知,最终产生真正的物理智能。
UTAM:在统一基座内同时具备认知智能与接触智能
基于这个判断,LatentVerse提出了UTAM,其包含多个协同工作的专家模块。视觉语言专家负责理解环境观测与任务意图;世界模型专家将过去从视频中学习到的技能与物理规律进行组合,并推演不同动作可能产生的未来结果;动作专家根据视觉语言推理链生成可开环执行的Latent Action,再由高频运行的触觉专家根据接触力、滑移与物体形变,将其重建为精细的可执行动作,用于机器人末端闭环控制。
LatentVerse提出的认知系统不是在VLA与WAM之间二选一,而是在统一架构中融合VLM对物理世界、人类意图的理解能力以及世界模型对未来状态、表征的预测能力,帮助智能体在真实世界中涌现出相当于GPT等语言模型的强推理能力。
目前,LatentVerse 已经完成 UTAM 的多模态数据Infra与训练管线建设,打通视频、语言、机器人状态、动作与触觉等多模态数据的采集、清洗、时间同步、对齐、标注和训练链路。团队正在推进 UTAM 各专家模块的联合训练,重点评估模型在未见物体与环境中的组合泛化能力、多步骤长程任务执行能力,以及面对滑移、形变和受力异常时的触觉闭环修正能力。
未来,LatentVerse 计划在模型能力、数据体系和真实部署经验成熟后,向机器人本体与应用场景延伸。
就如创始人胡钰承所说:“泛化、长程与灵巧不是三个彼此独立的技术指标,而是机器人商业化必须同时满足的能力条件。UTAM 希望让机器人不仅能够理解任务和生成动作,也能够在真实接触过程中感知变化、快速修正并持续完成复杂操作。”
高瓴创投项目负责人表示:“具身智能正从技术验证走向真实场景落地,泛化能力、长程任务执行和灵巧操作,是行业需要持续突破的关键能力。潜界科技团队兼具扎实的技术积累与产业洞察,其自研UTAM模型将触觉作为原生模态纳入统一架构,实现了‘边想、边做、边修正’的闭环,让机器人能够在与真实环境的持续交互中感知、决策、执行并动态调整。高瓴创投长期关注具身智能产业的发展,期待潜界科技持续推进具身基座模型的技术探索与工程化落地,加快具身智能走进更多真实场景。”
智元CVC表示:清华胡钰承团队作为WAM、分层架构方向最早的开创团队,国内外多家大厂的模型范式都在沿用他们的架构和模型思路。同时团队有大厂千卡以上的具身基础模型的Scaling经验,这也是对团队做进一步超大规模世界模型训练的信心来源。期待这支世界模型native的年轻团队在具身基础模型上的原创突破。
清流资本投资负责人表示:目前具身智能发展的核心痛点之一是对环境变化的适应以及精细的灵巧操作,LatentVerse团队敏锐地捕捉到了多模态触觉闭环破局点。不单纯依赖分层架构中感知与控制的割裂,将高维认知慢系统与高频触觉快系统有机统一。清流高度认同团队的技术愿景,期待团队在具身智能世界模型领域持续领跑。
英诺基金认为:潜界科技创始团队不仅年轻,还是国内较早将视频生成与世界模型应用于具身智能的探索者之一。CEO胡钰承自博士期间起便持续深耕统一世界模型方向,先后参与并主导了PAD、VPP、UP-VLA、Bagel-VLA等代表性工作,形成了清晰且持续演进的技术主线。相比近年来涌现的众多年轻团队,潜界少有地具备长期聚焦单一技术方向的积累,其技术演进路径清晰,原创性和持续创新能力突出。
查看更多项目信息,请前往「睿兽分析」。







