中科大团队把会「倒推」世界模型塞进了机器人,拿下数千万融资!

中科大团队把会「倒推」世界模型塞进了机器人,拿下数千万融资!
2026年10月11日 14:21 机器之心Pro

想象你站在一条产线旁边。

纸箱一个接一个地往前走。有的歪了,有的少装了一件,有的日期打码印错了。

线边的机械臂要在箱子移动的过程中发现问题,然后伸手、抓取、补料。

整个过程,5 秒以内。

听起来不难?

难点在于,箱子在动,机械臂也在动。它不能等箱子停下来再看清楚,而是必须提前判断:下一秒箱子会到哪里?现在伸手,会不会碰到别的东西?

换句话说,机器人得先在「脑子里」把接下来的几秒预演一遍。

这种在脑子里预演世界的能力,有个专门的名字:世界模型。

而让这条产线上的机械臂拥有这颗「大脑」的,是一家成立不到半年的合肥公司:白泽通境。

它做的不只是某一个算法,而是一整套能装进机器人身体里的具身大脑:负责理解世界的溯因式世界模型 AWM,负责把模型压进机器人的端侧推理引擎 BAIZ-RUN,以及最终承载它们的计算终端。

白泽通境的具身大脑三层结构

先预测,再溯因:

一颗会问「为什么」的大脑

过去两年,世界模型几乎成了具身智能里最热的词。

但大多数世界模型做的事,可以概括成一句话:看着现在,猜下一秒。

这已经很厉害了,但还差一步。

一个小孩看到皮球滚向桌角,知道它要掉下去,这是预测;他还知道为什么会掉下去,因为桌子到头了、球还在往前滚,这是理解。

白泽的 AWM(Abductive World Model,溯因式世界模型)要补上的,正是后面这一步。创始人白寅岐把它的思路概括成六个字:

先预测,再溯因。

AWM 先预测世界接下来会变成什么样,再反过来追问:是什么导致了这种变化?它把答案拆成三个问题:

谁在场?(Entity,实体)画面里有哪些物体。

怎么动?(Dynamic,动态)这些物体如何随时间变化。

会碰到谁?(Relation,关系)哪些物体之间会相互作用。

AWM 整体架构 | 图源:白泽通境 AWM 论文

如果用一个更直观的比喻:普通的世界模型像一份天气预报,告诉你明天会下雨;AWM 更像一位气象学家,还能告诉你雨是从哪片云来的。

对机器人来说,后者有用得多。它拿到的不是一张模糊的「未来画面」,而是一份结构清楚的「世界说明书」:哪个箱子先到,哪两个物体可能相撞,什么时候该伸手。

看视频就能学,而且学得快

训练世界模型,最贵的往往不是算力,而是数据。

传统做法需要大量人工标注:这一帧里有什么,那个物体往哪儿走,都得有人一条条标出来。

AWM 则可以直接从大量无标注视频里学习物体、运动和交互的规律,有点像人通过「看」来认识世界。互联网和工厂里本来就有海量视频,训练数据可以跟着视频来源一起增长。

它还学得特别快。

在 Push-T 机器人操作任务上,达到 75% 的成功率,AWM 只用了 2,000 条训练轨迹;对比方法 Causal-JEPA 需要 14,728 条,是前者的 7 倍多。

听到这儿你可能会问:数据少了这么多,效果不会打折吗?

恰恰相反。当训练数据同样加到 14,728 条时,AWM 的成功率达到了约 92%。

对机器人公司来说,这笔账很直观:真实世界里的每一条操作数据,都要靠人和机器一条条采。同样的效果只要约七分之一的数据,落地成本就降了一大截。

团队已发布论文

白泽通境已将 AWM 整理为论文《Abductive World Modeling via Causal Representation Learning》公开发布,并开源了代码。论文提出:预测得准,不等于理解了世界;一个好的世界模型,还得说得清自己的判断依据。

  • 论文标题:Abductive World Modeling via Causal Representation Learning
  • 论文地址:https://arxiv.org/abs/2609.36985
  • 代码地址:https://github.com/baiz-tech/AWM

实验显示:

  • 与 V-JEPA 2 相比,AWM 在物理结果预测、事件推理、动作理解三类任务上均有提升,其中动作理解 Top-1 准确率提升 68%;
  • 遮挡画面中的关键物体时,模型判断的变化是遮挡无关物体时的 3.9 倍。它的预测真的建立在「认出来」的物体之上,而不是在蒙。

各数据集的主要比较 | 来源:AWM论文Table1

「说得清依据」在工厂里很要命。产线可以容忍机器偶尔出错,但很难接受出了错却找不到原因。

2bit 量化:

把世界模型塞进机器人

模型再聪明,跑不进机器人也是白搭。

内行人会问:世界模型这种级别的运算,不得放在机房里跑?机器人身上那点算力,开什么玩笑?

这正是问题所在。聊天机器人可以把计算放在云端,慢几秒无所谓;可流水线上的箱子不会停下来等机械臂「想清楚」,巡检机器人撞上障碍物之前也没有时间等网络。机器人身上的芯片、内存和电池都很有限,大模型想上车,得先「瘦身」。

白泽的答案是自研的端侧推理引擎 BAIZ-RUN。

它的核心是两招:

压得更小。通过误差感知量化等方法,把模型权重压到 2 bit、激活压到 4 bit,同时保持精度。打个比方,就像把一套厚厚的百科全书压成一本口袋书,内容却基本没丢。

跑得更快。通过融合算子和底层计算优化,减少推理过程中的冗余计算和内存搬运。

说着轻巧,做起来极难。

把世界模型压进一块边缘芯片,不是压缩打包那么简单。量化要省空间又不能丢精度,算子要和芯片架构一一适配,延迟、功耗、发热,全是硬骨头。

效果如何?团队在 AMD Radeon 边缘集成显卡和 SSV2 数据集上的测试显示:

内存占用降低 2.56 倍,推理频率提升 94.6%,精度损失不到 1%

也就是说,同一块边缘芯片上,模型占的地方少了一大半,跑得快了将近一倍,判断的准确度却几乎没变。

BAIZ-RUN 的技术路线与测试效果

还有两个细节值得注意。

第一,它不挑芯片。机器人行业的硬件极其分散,不同厂商、甚至同一厂商的不同产品线都可能用不同的芯片。BAIZ-RUN 同时面向 NVIDIA、AMD 和华为昇腾构建多后端推理体系,同一套方案可以在不同硬件上复用,降低世界模型的迁移和部署成本。

这也是值得注意的细节,这套infra将能实现完全国产硬件跑通,它带来的成本缩减将成为规模化落地的关键一掷。

第二,它不挑模型。按照规划,V-JEPA、DINO-WM 这样的表征式世界模型,以及 VLA 等多模态大模型,都可以通过 BAIZ-RUN 部署到端侧。团队把它的目标类比为大模型领域的 vLLM:让各种模型都能高效跑起来的通用推理底座。

即插即用:

一颗能装进不同机器人的大脑

模型有了,引擎有了,最后一步是硬件。

白泽计划与硬件厂商合作推出端侧计算终端,把世界模型和 BAIZ-RUN 装进一台可以直接接到机器人上的设备里。按照团队的设计,这台终端基于国产算力平台,主打四个特点:

成本低。2-bit 超低比特量化让单机成本可控,适合规模化部署。

端侧可靠。本地离线推理,不依赖网络,满足现场作业的可靠性要求。

数据不出厂。推理和数据都在本地闭环,适合对数据安全要求高的场景。

即插即用。通过标准化接口适配多类机器人本体,同一颗「大脑」可以复用到不同的机器人上。

从模型、到推理引擎、再到计算终端,白泽通境的布局并不止于训练一个模型,而是要打通从模型能力到端侧运行的整条工程链路。

用白泽的话说:本体厂商负责「身体」,白泽负责「大脑」。

不只是论文:

场景落地才是真正的护城河

实验室里的分数只是起点。白泽最值得关注的一点,是它已经把这颗大脑放进了真实场景。

目前,三个工业场景已经签约,并完成了实际验证:

工业上下料。就是开头那条产线。来料多变的情况下,5 秒内识别异常并完成补料,靠的是动态预测和快速决策。

工业质检。面对多种型号的来料,机器人要泛化地抓取并完成质检,考验的是泛化识别和空间定位。

厂区巡检。面对事先不知道的障碍物实时避障,依赖运动预测和路径规划。

三个已签约场景的实际验证

依托合肥的政府资源和中科大生态,白泽搭起了一张覆盖上下游的合作网络:

场景方:万宇科技(奔驰、华为、比亚迪的供货商)、卫岗(中国乳业 20 强),以及一家立讯精密的合作企业。

本体方:清华系头部本体厂商零次方(ZERITH)、中科大系本体方小步智能、处于 Pre-IPO 阶段的逐际动力(LimX Dynamics)。

数据采集基地:依托国先中心支持,加入市级规模数采基地,形成双向反哺。

场景方带来真实需求,本体方提供能装「大脑」的机器人,数据基地支撑模型继续学习。场景里产生的新数据,又会回到训练管线,让下一版模型更聪明。

白寅岐的判断是:具身智能很难照搬大语言模型「先通用、后落地」的路子。机器人面对的物理世界差异太大,与其先造一个什么都懂的通用大脑,不如从具体场景切进去,再一步步走向通用。

放到全球坐标系里看:

JEPA 路线之外的另一种解法

把 AWM 放进全球世界模型的格局里,不难看出它的野心。

在隐空间世界模型这条路上,最有代表性的是 Yann LeCun 提出的 JEPA 路线,Meta 的 V-JEPA 2 就是其中的代表作之一。它们的思路是不去逐像素生成画面,而是在抽象的特征空间里预测未来。

AWM 和这条路线有不少共同点:都从视频中学习,都在隐空间里预测世界的变化,都服务于机器人的理解和规划。

但差异同样明显:

多了一步「溯因」。在预测之外,AWM 还把世界拆成实体、动态和关系,说得清预测从何而来。论文中,与 V-JEPA 2 相比,AWM 在物理预测、事件推理、动作理解三类任务上均有提升。

数据效率更高。在 Push-T 任务上,达到同样 75% 的成功率,AWM 所需的轨迹数约为 Causal-JEPA 的七分之一。

从一开始就考虑端侧。借助 BAIZ-RUN 的 2-bit 量化和多芯片适配,包括对华为昇腾的支持,AWM 不只停留在服务器上,而是奔着机器人本地运行去的。

如果说 JEPA 路线回答的是「机器能不能预测世界」,白泽想继续回答的是:机器能不能说清楚为什么,以及这种能力能不能真正装进一台机器人。

成立三个月:

中科大团队的具身大脑征途

最后,细聊这家科大出身的公司。

白泽通境成立不到半年,团队主体来自中国科学技术大学,并从大厂和海外引入了商业、数据与工程人才。创始人白寅岐此前从事模型量化相关研究,这部分积累后来成为了 BAIZ-RUN 的技术底子。他给公司的定位是「场景驱动的通用具身大脑」。

资本的反应很快。

公司在成立不到三个月时完成了首轮数千万元人民币融资。首轮股东包括半导体产业龙头投资机构中芯聚源,以及科大硅谷为LP的市场化机构;合肥本地及其他市场化VC参与的加轮目前正在协议中,投后估值将超4亿;第二轮也已经稳步开展中。

此外,白泽通境入选了长城企业战略咨询发布的《2026 中国科创未来之星企业研究报告》。这份榜单全国共 97 家企业入选,合肥仅 6 家。

它瞄准的客户也不只是机器人公司:模型团队可以用它的数据管线,已有模型的公司可以单独采用 BAIZ-RUN,机器人本体厂商可以接入整套大脑,行业客户则可以和白泽、本体厂商一起完成集成与二次开发。

当然,路还很长。AWM 在更多新环境中的表现、BAIZ-RUN 在更多芯片上的效果、工业项目能否从验证走向批量部署,都还需要时间来回答。

但方向已经很清楚:世界模型不该只漂在论文和实验室里。

白泽通境想做的,是让这颗会「倒推」的大脑,真正装进每一台机器人。

财经自媒体联盟更多自媒体作者

新浪首页 语音播报 相关新闻 返回顶部