想象你站在一条产线旁边。
纸箱一个接一个地往前走。有的歪了,有的少装了一件,有的日期打码印错了。
线边的机械臂要在箱子移动的过程中发现问题,然后伸手、抓取、补料。
整个过程,5 秒以内。
听起来不难?
难点在于,箱子在动,机械臂也在动。它不能等箱子停下来再看清楚,而是必须提前判断:下一秒箱子会到哪里?现在伸手,会不会碰到别的东西?
换句话说,机器人得先在「脑子里」把接下来的几秒预演一遍。
这种在脑子里预演世界的能力,有个专门的名字:世界模型。
而让这条产线上的机械臂拥有这颗「大脑」的,是一家成立不到半年的合肥公司:白泽通境。
它做的不只是某一个算法,而是一整套能装进机器人身体里的具身大脑:负责理解世界的溯因式世界模型 AWM,负责把模型压进机器人的端侧推理引擎 BAIZ-RUN,以及最终承载它们的计算终端。

白泽通境的具身大脑三层结构
先预测,再溯因:
一颗会问「为什么」的大脑
过去两年,世界模型几乎成了具身智能里最热的词。
但大多数世界模型做的事,可以概括成一句话:看着现在,猜下一秒。
这已经很厉害了,但还差一步。
一个小孩看到皮球滚向桌角,知道它要掉下去,这是预测;他还知道为什么会掉下去,因为桌子到头了、球还在往前滚,这是理解。
白泽的 AWM(Abductive World Model,溯因式世界模型)要补上的,正是后面这一步。创始人白寅岐把它的思路概括成六个字:
先预测,再溯因。
AWM 先预测世界接下来会变成什么样,再反过来追问:是什么导致了这种变化?它把答案拆成三个问题:
谁在场?(Entity,实体)画面里有哪些物体。
怎么动?(Dynamic,动态)这些物体如何随时间变化。
会碰到谁?(Relation,关系)哪些物体之间会相互作用。

AWM 整体架构 | 图源:白泽通境 AWM 论文
如果用一个更直观的比喻:普通的世界模型像一份天气预报,告诉你明天会下雨;AWM 更像一位气象学家,还能告诉你雨是从哪片云来的。
对机器人来说,后者有用得多。它拿到的不是一张模糊的「未来画面」,而是一份结构清楚的「世界说明书」:哪个箱子先到,哪两个物体可能相撞,什么时候该伸手。
看视频就能学,而且学得快
训练世界模型,最贵的往往不是算力,而是数据。
传统做法需要大量人工标注:这一帧里有什么,那个物体往哪儿走,都得有人一条条标出来。
AWM 则可以直接从大量无标注视频里学习物体、运动和交互的规律,有点像人通过「看」来认识世界。互联网和工厂里本来就有海量视频,训练数据可以跟着视频来源一起增长。
它还学得特别快。
在 Push-T 机器人操作任务上,达到 75% 的成功率,AWM 只用了 2,000 条训练轨迹;对比方法 Causal-JEPA 需要 14,728 条,是前者的 7 倍多。
听到这儿你可能会问:数据少了这么多,效果不会打折吗?
恰恰相反。当训练数据同样加到 14,728 条时,AWM 的成功率达到了约 92%。
对机器人公司来说,这笔账很直观:真实世界里的每一条操作数据,都要靠人和机器一条条采。同样的效果只要约七分之一的数据,落地成本就降了一大截。
团队已发布论文
白泽通境已将 AWM 整理为论文《Abductive World Modeling via Causal Representation Learning》公开发布,并开源了代码。论文提出:预测得准,不等于理解了世界;一个好的世界模型,还得说得清自己的判断依据。

- 论文标题:Abductive World Modeling via Causal Representation Learning
- 论文地址:https://arxiv.org/abs/2609.36985
- 代码地址:https://github.com/baiz-tech/AWM
实验显示:
- 与 V-JEPA 2 相比,AWM 在物理结果预测、事件推理、动作理解三类任务上均有提升,其中动作理解 Top-1 准确率提升 68%;
- 遮挡画面中的关键物体时,模型判断的变化是遮挡无关物体时的 3.9 倍。它的预测真的建立在「认出来」的物体之上,而不是在蒙。

各数据集的主要比较 | 来源:AWM论文Table1
「说得清依据」在工厂里很要命。产线可以容忍机器偶尔出错,但很难接受出了错却找不到原因。
2bit 量化:
把世界模型塞进机器人
模型再聪明,跑不进机器人也是白搭。
内行人会问:世界模型这种级别的运算,不得放在机房里跑?机器人身上那点算力,开什么玩笑?
这正是问题所在。聊天机器人可以把计算放在云端,慢几秒无所谓;可流水线上的箱子不会停下来等机械臂「想清楚」,巡检机器人撞上障碍物之前也没有时间等网络。机器人身上的芯片、内存和电池都很有限,大模型想上车,得先「瘦身」。
白泽的答案是自研的端侧推理引擎 BAIZ-RUN。
它的核心是两招:
压得更小。通过误差感知量化等方法,把模型权重压到 2 bit、激活压到 4 bit,同时保持精度。打个比方,就像把一套厚厚的百科全书压成一本口袋书,内容却基本没丢。
跑得更快。通过融合算子和底层计算优化,减少推理过程中的冗余计算和内存搬运。
说着轻巧,做起来极难。
把世界模型压进一块边缘芯片,不是压缩打包那么简单。量化要省空间又不能丢精度,算子要和芯片架构一一适配,延迟、功耗、发热,全是硬骨头。
效果如何?团队在 AMD Radeon 边缘集成显卡和 SSV2 数据集上的测试显示:
内存占用降低 2.56 倍,推理频率提升 94.6%,精度损失不到 1%
也就是说,同一块边缘芯片上,模型占的地方少了一大半,跑得快了将近一倍,判断的准确度却几乎没变。

BAIZ-RUN 的技术路线与测试效果
还有两个细节值得注意。
第一,它不挑芯片。机器人行业的硬件极其分散,不同厂商、甚至同一厂商的不同产品线都可能用不同的芯片。BAIZ-RUN 同时面向 NVIDIA、AMD 和华为昇腾构建多后端推理体系,同一套方案可以在不同硬件上复用,降低世界模型的迁移和部署成本。
这也是值得注意的细节,这套infra将能实现完全国产硬件跑通,它带来的成本缩减将成为规模化落地的关键一掷。
第二,它不挑模型。按照规划,V-JEPA、DINO-WM 这样的表征式世界模型,以及 VLA 等多模态大模型,都可以通过 BAIZ-RUN 部署到端侧。团队把它的目标类比为大模型领域的 vLLM:让各种模型都能高效跑起来的通用推理底座。
即插即用:
一颗能装进不同机器人的大脑
模型有了,引擎有了,最后一步是硬件。
白泽计划与硬件厂商合作推出端侧计算终端,把世界模型和 BAIZ-RUN 装进一台可以直接接到机器人上的设备里。按照团队的设计,这台终端基于国产算力平台,主打四个特点:
成本低。2-bit 超低比特量化让单机成本可控,适合规模化部署。
端侧可靠。本地离线推理,不依赖网络,满足现场作业的可靠性要求。
数据不出厂。推理和数据都在本地闭环,适合对数据安全要求高的场景。
即插即用。通过标准化接口适配多类机器人本体,同一颗「大脑」可以复用到不同的机器人上。
从模型、到推理引擎、再到计算终端,白泽通境的布局并不止于训练一个模型,而是要打通从模型能力到端侧运行的整条工程链路。
用白泽的话说:本体厂商负责「身体」,白泽负责「大脑」。
不只是论文:
场景落地才是真正的护城河
实验室里的分数只是起点。白泽最值得关注的一点,是它已经把这颗大脑放进了真实场景。
目前,三个工业场景已经签约,并完成了实际验证:
工业上下料。就是开头那条产线。来料多变的情况下,5 秒内识别异常并完成补料,靠的是动态预测和快速决策。
工业质检。面对多种型号的来料,机器人要泛化地抓取并完成质检,考验的是泛化识别和空间定位。
厂区巡检。面对事先不知道的障碍物实时避障,依赖运动预测和路径规划。
三个已签约场景的实际验证
依托合肥的政府资源和中科大生态,白泽搭起了一张覆盖上下游的合作网络:
场景方:万宇科技(奔驰、华为、比亚迪的供货商)、卫岗(中国乳业 20 强),以及一家立讯精密的合作企业。
本体方:清华系头部本体厂商零次方(ZERITH)、中科大系本体方小步智能、处于 Pre-IPO 阶段的逐际动力(LimX Dynamics)。
数据采集基地:依托国先中心支持,加入市级规模数采基地,形成双向反哺。
场景方带来真实需求,本体方提供能装「大脑」的机器人,数据基地支撑模型继续学习。场景里产生的新数据,又会回到训练管线,让下一版模型更聪明。
白寅岐的判断是:具身智能很难照搬大语言模型「先通用、后落地」的路子。机器人面对的物理世界差异太大,与其先造一个什么都懂的通用大脑,不如从具体场景切进去,再一步步走向通用。
放到全球坐标系里看:
JEPA 路线之外的另一种解法
把 AWM 放进全球世界模型的格局里,不难看出它的野心。
在隐空间世界模型这条路上,最有代表性的是 Yann LeCun 提出的 JEPA 路线,Meta 的 V-JEPA 2 就是其中的代表作之一。它们的思路是不去逐像素生成画面,而是在抽象的特征空间里预测未来。
AWM 和这条路线有不少共同点:都从视频中学习,都在隐空间里预测世界的变化,都服务于机器人的理解和规划。
但差异同样明显:
多了一步「溯因」。在预测之外,AWM 还把世界拆成实体、动态和关系,说得清预测从何而来。论文中,与 V-JEPA 2 相比,AWM 在物理预测、事件推理、动作理解三类任务上均有提升。
数据效率更高。在 Push-T 任务上,达到同样 75% 的成功率,AWM 所需的轨迹数约为 Causal-JEPA 的七分之一。
从一开始就考虑端侧。借助 BAIZ-RUN 的 2-bit 量化和多芯片适配,包括对华为昇腾的支持,AWM 不只停留在服务器上,而是奔着机器人本地运行去的。
如果说 JEPA 路线回答的是「机器能不能预测世界」,白泽想继续回答的是:机器能不能说清楚为什么,以及这种能力能不能真正装进一台机器人。
成立三个月:
中科大团队的具身大脑征途
最后,细聊这家科大出身的公司。
白泽通境成立不到半年,团队主体来自中国科学技术大学,并从大厂和海外引入了商业、数据与工程人才。创始人白寅岐此前从事模型量化相关研究,这部分积累后来成为了 BAIZ-RUN 的技术底子。他给公司的定位是「场景驱动的通用具身大脑」。
资本的反应很快。
公司在成立不到三个月时完成了首轮数千万元人民币融资。首轮股东包括半导体产业龙头投资机构中芯聚源,以及科大硅谷为LP的市场化机构;合肥本地及其他市场化VC参与的加轮目前正在协议中,投后估值将超4亿;第二轮也已经稳步开展中。
此外,白泽通境入选了长城企业战略咨询发布的《2026 中国科创未来之星企业研究报告》。这份榜单全国共 97 家企业入选,合肥仅 6 家。
它瞄准的客户也不只是机器人公司:模型团队可以用它的数据管线,已有模型的公司可以单独采用 BAIZ-RUN,机器人本体厂商可以接入整套大脑,行业客户则可以和白泽、本体厂商一起完成集成与二次开发。
当然,路还很长。AWM 在更多新环境中的表现、BAIZ-RUN 在更多芯片上的效果、工业项目能否从验证走向批量部署,都还需要时间来回答。
但方向已经很清楚:世界模型不该只漂在论文和实验室里。
白泽通境想做的,是让这颗会「倒推」的大脑,真正装进每一台机器人。
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有
