年营收10亿,这家公司靠“脏活累活”把世界模型跑通了

关注
酷哇科技
安徽人工智能
世界模型驱动的城市具身智能全栈方案商
最新融资:Pre-IPO轮|过6亿美元|2026-06-22
我要联系
面向真实场景的端侧世界模型。

图片

作者丨流光

编辑丨关雎

图源丨酷哇科技&AI辅助生成

机器人上路干活,面对的是一个永远在和它“对着干”的世界:昨天下雨、今天暴晒,这个路口突然窜出外卖车,那个小区门口堆着刚卸的快递——它看到的每个场景都是新的,靠工程师提前写规则,写不完也写不过来。

所以机器人需要一套世界模型,在真正动手之前,先在“脑子里”把接下来可能发生的事推演一遍。

简单来说,世界模型是AI的“内部模拟器”:它通过学习环境的变化规律,根据当前状态和可能采取的动作,推演“接下来可能发生什么”,从而帮助智能体做出决策。

这两年,世界模型几乎是AI领域最炙手可热和吸金的方向之一。据创业邦《2026世界模型专题研究报告》,仅2026年前7个月,中国一级市场就有666亿元资金涌向这个赛道。杨立昆、李飞飞等科技领军人物、英伟达等国内外科技巨头,以及一众创业公司,都在这个领域进行探索。

目前来看,世界模型的发展尚处早期,技术路线尚未收敛,大规模商业化应用的案例并不多。

酷哇科技(Coowa)是入局世界模型的公司之一。公司称,其世界模型已部署到运营中的机器人产品。

自2015年成立以来,酷哇一直面向城市开放环境下的环卫、末端配送、短途接驳等场景研发机器人,先后推出四足机器人、城市作业服务机器人和无人驾驶小巴等产品。截至2025年底,公司已在全球50多座城市累计落地超1万台机器人,公司采用按服务收费的模式(RaaS)),在手订单金额超50亿元,年营收10亿元,且EBITDA(息税折旧摊销前利润)已转正。

图片

酷哇科技产品实例

这些长期运行在真实环境中的机器人,为公司积累了超过50PB真实物理世界数据。基于这些积累,酷哇在2026年推出了世界模型系列产品。

2月,发布Coowa WAM 2.0通用世界模型底座。这是一个可学习的神经模拟器,通过统一建模世界状态、机器人动作和任务目标,让机器人能够在行动前推演可能的后果。5月,进一步推出CooWAIM 2.0(交互式世界—动作模型),解决机器人在物理世界中“怎么动”的执行问题。

到2026年7月,正式披露融合“快思考”和“慢思考”的双层智能体世界模型架构COOWAM。该架构包含上层Urban VLM(城市视觉语言模型)和下层CooWAIM,分别负责慢思考规划和快思考执行,让机器人能够在复杂的物理世界中完成理解、状态推演与自适应决策。

发展过程中,资本也不断加入,酷哇拥有一套聚齐国家队和美元风投的投资人阵容,据悉其累计融资金额已超过6亿美元。

01面向真实场景的端侧世界模型

酷哇科技CTO廖文龙认为,机器人真正需要的世界模型,并不是单一的物理世界模型,而是物理世界模型与人类社会世界模型的统一。只有同时具备这两类理解能力,Physical Agent才有可能进入真实环境并创造生产力。

世界模型好不好用,核心指标只有一个:预测得够不够准。世界模型预测的够准,本质上就是使得机器人能够懂物理世界规律、以及懂如果人在物理世界中会有哪些社会运转规律。

图片

图片

物理世界模型+人类社会世界模型示意图

物理世界模型,解决的是“懂物理”的问题:机器人要理解物体的运动和因果——纸箱被风一吹会滚到车道上,泼了水的路面会打滑,这是物理规律。

人类社会世界模型,解决的是“懂人”的问题:机器人还要理解社会运转的规则——红灯停绿灯行、行人过马路会犹豫、早高峰的非机动车道有多挤,这是城市里的“人情世故”。

多数企业从模型能力出发寻找落地场景,酷哇则从多年来运营环卫、末端配送、短途接驳机器人的规模化真实需求出发,反向构建模型能力。

万台级设备在开放城市环境里运行,云端方案在延迟、成本和断网安全上都无法满足要求,对酷哇来说,端侧世界模型是机器人规模化运营的必然选择。按廖文龙的话来说,酷哇给自己的定位是:一家瞄准机器人世界模型规模化端侧部署的公司。

首先是端侧部署,模型原生运行在机器人本体上;二是需求明确,技术只投向已经被市场验证、有人愿意买单的真实场景。

沿着这条思路,酷哇在2026年构建了一套完整的架构。它不是单个模型,而是一个三层搭起来的体系:上层Urban VLM慢思考“该做什么”,下层CooWAIM快思考“怎么做”,而它的认知内核,是WAM 2.0里System 1(直觉响应)与System 2(逻辑推理)双核架构在系统层面的放大。

架构搭好之后,酷哇正在尝试将其复用到形态各异的机器人上,公司已经完成从环卫轮式机器人到四足、轮足式机器人的形态扩展。酷哇认为,跨本体复用的是世界模型学习到的物理世界理解能力;不同本体在执行层面的差异,由动作模型的联合训练完成适配。

架构立起来之后,还有一个问题是:这套世界模型怎么在端侧的两张英伟达GPU上跑得动?酷哇的答案是:不让机器人“想太远”,而是“想得刚刚好”——聚焦0-4秒的短时未来,边执行、边推演、边修正。为什么是0-4秒?因为在开放场景下,安全永远是第一优先级,而安全风险通常集中在未来4秒之内:一次紧急避让、一个突然闯入的行人,留给机器人的反应窗口就这么长。

为了在这4秒内做到既快又准、还不超出端侧算力的预算,酷哇做了三层工作。

第一层,解决“推演放在哪里算”。把推演过程从直接处理高维视觉数据,转移到高度压缩的隐空间:只保留路网、障碍物等关键物理信息,推演不再依赖对未来画面的生成与渲染。据酷哇披露,这一设计可将整体计算量降低约75%,推理延迟压至百毫秒以内。

第二层,回答“要推演多深”。传统世界动作模型对所有场景分配固定的推演预算——空旷的凌晨主干道和人流交织的复杂路口,消耗同样的算力。酷哇把推演变成逐步决策的过程:每完成一步,潜在评估器预估已揭示的风险和继续推演的收益,推演门控再将收益与算力成本实时权衡——收益大于成本就继续(ROLL),否则立即停止(STOP)。

第三层,是数据。酷哇用AIGC技术在真实场景起始帧上批量生成危险结局(10秒、1080p视频),经专家验证和人工标注后,形成“真实—反事实”成对的监督信号。据公司披露,引入该数据集后,模型在1-4秒各时间窗的风险识别AUC(衡量模型区分危险与安全场景能力的指标,越接近1越好)从约0.5提升至0.93以上,事故识别准确率达0.96。

值得注意的是,世界模型的目标是让AI理解物理世界的运行规律,而这种理解只能从数据中习得。但数据规模并不直接等于模型能力,更核心的挑战在于数据如何被有效使用。廖文龙认为,数据分布、数据流水线、算法等因素共同决定了数据能否真正转化为模型能力。

为此,酷哇将数据组织为三层结构:动态场景数据、物理交互数据、真机纠偏数据,分别对应机器人认识环境、理解交互和执行任务的不同环节,并通过物理AI数据工厂完成自动化清洗、标注与生产,用于模型训练。

如今,酷哇已将COOWAM模型部署至现有产品矩阵。每当机器人执行一次任务,便完成一次数据验证,新的运行数据会回流至模型训练中,进入下一轮迭代,形成“运行—数据—训练—再部署”的持续循环。

图片

数据金字塔示意图

02先确定有人买单,再去养鸡

酷哇创始人何弢是浙江义乌人,本科毕业于上海交通大学电子信息专业,后赴日本东京工业大学师从机器人专家广濑茂男(Hirose Shigeo),获得硕士及博士学位,2012年底回国后进入交大自动化系任教。

另一位创始人廖文龙同样出身上海交大,拥有计算机专业硕博学位。两人曾在交大实验室一起做机器人研究,2015年共同创立酷哇科技,希望做出能够创造实际生产力的通用机器人。

图片

酷哇科技联合创始人CTO 廖文龙

但一开始,酷哇做的并不是今天的城市服务机器人。公司的第一款产品是 ROVAR 智能行李箱,搭载激光雷达、机器视觉和 UWB 技术,可以在半开放环境中自动跟随和避障,也是世界首款量产上市的机器人行李箱。

当时产品顺利完成了从研发、量产到销售的完整闭环,但由于行李箱本身是低频消费品,“自动跟随”的新鲜感没能转化为持续的品类需求,市场始终没有放量,最终于2018年停产。

这次尝试让团队确认了一件事:技术能跑通,和用户愿意持续买单,中间隔着一个真实的市场。

2017 到2018 年,酷哇开始密集寻找更适合机器人的落地场景。团队先后考察了送餐、港口、机场、矿区、干线物流和 Robotaxi 等自动驾驶方向,最终将目光投向市政环卫业务。

“市政环卫不是一个fancy的场景。”廖文龙起初并不看好这一选择,担心长期下去,会让酷哇成为一家只做特定场景机器人的公司。最终,何弢说服了他。因为虽然环卫包含大量“dirty work”,但机器人需要同时解决移动和操作两方面问题,在很多场景具备算法扩展的通用性。更重要的是,当时已经有客户愿意为技术开发付费,是完全由需求驱动的场景。

先有买蛋的人,再去养鸡。这条从十年商业探索里长出来的纪律,后来也贯穿了酷哇的每一次技术选型。

03为什么是端侧?

进入市政环卫场景之后,酷哇开始切入城市自动驾驶领域。技术路线上,公司没有沿用当时乘用车自动驾驶高度依赖高精度地图和GPS的路径,而是聚焦城市开放环境下的L4级自动驾驶。

最初,团队采用多传感器融合和模块化架构,将感知、定位、预测、规划和控制分别处理,并通过特征驱动的全局定位方法,解决树木、楼宇遮挡导致GPS信号不稳定的问题。后来,整套技术被集成到CO-MOVE PRO低速无人驾驶系统中。

2018年,酷哇与中联环境联合发布无人驾驶扫地车,可实现自主清扫、路径规划和动态避障,率先在长沙、芜湖、合肥、上海等地商业化落地,随后推广至更多城市。

做无人车的过程,也是酷哇一步步确认“端侧”路线的过程。道理并不复杂:城市开放环境下的作业不能假设网络永远在线——地库、隧道、高楼与树荫遮挡的区域,信号随时可能减弱甚至中断,而正在作业的机器人不能因此停摆。这决定了模型必须在机器人本体上完成实时推理,而不是把数据传回云端再等答案。

所以酷哇的模型从设计第一天起,就是围绕端侧部署和大规模运营来做的“原生端侧模型”——不是先训练一个云端大模型,再蒸馏压缩搬到小算力芯片上。为了支撑端侧的实时推演,酷哇在每台机器人上都配置了两张英伟达高算力GPU。不用功耗更低的常规车端芯片,是因为要跑的模型不一样。

图片

酷哇科技X0机器狗在北京首钢园进行作业

但随着业务进入更多元、更复杂的城市环境,分模块算法在长尾场景下逐渐遇到瓶颈。于是,2023年酷哇将核心算法从基于激光雷达和视觉的多模态感知融合的分段式架构,转向视觉端到端架构,消除系统对人工规则的依赖,让模型根据实时环境完成决策。

与此同时,公司推出新一代自动驾驶小巴,进入城市微循环出行场景。2025年,公司发布UrbanVLM(Urban Vision-Language Model)大模型,通过引入语义级任务理解能力,让模型开始具备对任务和场景的理解能力。

在这些演进的基础上,最终在2026年收敛成一套完整的世界模型架构——COOWAM。

商业模式上,酷哇没有选择设备销售,而是通过RaaS(Result-as-a-Service,结果即服务)模式,将机器人、软件系统和运营服务打包,按最终作业效果向客户收费。扫得干净、送得准时,客户才会付费——效果不达标的风险由酷哇自己承担。其中,B端付费方占比已过半,主要客户覆盖大型国央企、头部物业和城服上市公司等。

04世界模型的下半场:数据与商业化

如果说大模型过去几年的竞争,主要围绕语言和多模态展开,那么世界模型正在把 AI 的能力边界进一步推向真实世界。

随着机器人、自动驾驶、空间智能逐步进入动态开放场景,行业对AI提出了更高的要求。真实世界始终处于变化之中,AI不仅要理解眼前发生了什么,还要理解环境如何变化,以及一个动作可能带来什么结果。

不过,行业对 “世界模型” 究竟是什么,还没有统一答案。

杨立昆推动的JEPA路线,强调在抽象的表征空间中预测世界状态。李飞飞则从空间智能出发,将世界模型概括为渲染器、模拟器和规划器三类,并认为能够遵守物理规律的模拟器,是物理AI落地的关键。World Labs发布的最新一代世界模型Atlas,也延续了这一思路。

据创业邦《2026世界模型专题研究报告》,目前行业大致可分为六大技术流派。除了上述两类,还包括视频模型、自动驾驶世界模型、机器人与物理AI、神经物理仿真。

图片

六大技术流派总揽

路线虽然不同,但最终都绕不开数据和商业化。

首先是数据。世界模型需要学习的,不只是图像和视频中的静态信息,还包括“状态—动作—结果”之间的变化规律。因此,相比主要依赖静态数据的大模型,世界模型对动态、连续的交互数据提出了更高要求。

这类数据的获取成本也更高。真实环境中的变化很难完全通过人工设计覆盖,尤其自动驾驶、机器人等应用需要通过持续运行积累数据,而更有价值的往往又是低频、复杂、难以重复的长尾场景。

极佳视界联合创始人朱政博士认为,自动驾驶与具身智能在“数据闭环飞轮”“端到端VLA架构”和“世界模型”等方向上高度共通,但训练数据来源存在差异。在他看来,构建数据闭环是提升世界模型能力的最大难点。

脸谱心智创始人陆弘远则判断,资本留给赛道验证的窗口期大约只有3-5年,但想要从根源补齐机器人的数据短板,可能需要长达10年的建设周期。

图片

图片

商业化同样面临考验。 目前,世界模型已经在3D内容生成、虚拟环境构建、AI训练数据生成等领域出现应用。但从实验室模型到车端或机器人本体上的实时部署,仍受限于算力、实时性和工程稳定性。完整的世界模型要真正进入每一次决策,还需经历更长时间的场景适配和迭代。

廖文龙始终认为:“世界模型也好,VLA也好,端到端也好,终归是要解决问题,而不是叙事上的一个概念符号。”

对这个仍在快速演进的行业而言,真正的考验才刚开始:模型能力能否进入真实场景,最终转化为稳定的产品和商业价值。

本文为创业邦原创,未经授权不得转载,否则创业邦将保留向其追究法律责任的权利。如需转载或有任何疑问,请联系editor@cyzone.cn。

反馈
联系我们
推荐订阅