依托人类静态数据训练的大模型范式已经不够,AI即将进入以智能体第一视角交互经验为核心的“经验时代”。智慧并不等于知识的堆砌,如果没有经验,超级智慧就不会存在。
——里查德·萨顿 图灵奖获得者,2026WAIC演讲
2016年3月,李世石投子认负的那一刻,人类第一次真正感受到了人工智能在复杂博弈中超越人类的可能性。
AlphaGo赢了——靠的是学习人类棋谱,模仿顶尖棋手的走法,在人类数千年的围棋智慧之上叠加了机器的算力。它很强,但本质上,它仍然是人类的影子。
一年半之后,DeepMind推出了AlphaZero。它没有看过任何一局人类棋谱,从随机下棋开始,只靠自我对弈,在三天之内以100比0的战绩击败了曾战胜李世石的AlphaGo Lee。
更令人震撼的是,AlphaZero进一步统一算法框架,在仅知道基本规则的情况下,24小时内相继击败了包括国际象棋和日本将棋在内的各领域世界冠军程序。

围棋大师们看了AlphaZero的棋路惊呼不已——原来围棋还可以这么下。
从AlphaGo到AlphaZero,表面上是算法的迭代,实质上是范式的跃迁:从模仿到自学,从数据到经验。前者是人类知识的集大成者,后者是第一性原理的践行者。
有意思的是,同样的路径分野,正在物理AI领域悄然上演。
一、物理AI的“AlphaGo时刻”
今天提到物理AI,大多数人脑子里浮现的是具身智能、人形机器人。人们默认——或者说,整个产业默认——物理AI就是要让机器人模仿人,以人的方式去完成现实世界里的任务。
于是有了VLA模型(视觉-语言-动作模型),以大语言模型为基座,试图让机器人“看懂”世界、“听懂”指令、“做出”动作。于是有了以人类视角采集数据来训练具身智能的范式——工人在工厂里佩戴摄像头,记录操作过程;操作员通过遥操设备一条一条地“教”机器人动作。于是有了人形机器人这个几乎被默认为物理AI终极形态的赛道。
这像极了当年的AlphaGo——从人类已有的经验出发,试图让机器复制并优化人类的行为模式。
但根本性的问题被忽略了:“为什么物理AI一定要搭建在人的视角、人的形态、人的方式这个体系里?”
二、99%的人都错看了物理AI的未来
物理AI的本质,是让AI走出屏幕,走进物理世界,去感知、理解、推理并执行真实环境中的复杂任务。它要做的是在真实物理世界中自主行动——但这个“自主”,为什么必须以“模仿人”为前提?
当前的VLA模型面临一个尴尬的困境:它的泛化能力极其有限。出了训练环境,换了相机视角,换了操作对象,模型的表现往往断崖式下跌。英伟达机器人方向负责人Jim Fan甚至直言“VLA已死”。
问题的根源在于数据。具身智能需要的是连续的关节力矩、末端位姿和触觉反馈,而非大语言模型处理的那种离散的Token。真机遥操速度慢、成本高,百万条真机数据或许仅能训练一个动作的泛化。有企业坦言,自采数据仅能满足训练需求的10%。而“以人为本”的人类数据采集,本质上是把物理AI的训练建立在对人类行为的模仿之上。
这套逻辑的潜台词是:物理AI必须先学会做人,才能做事。
而AlphaZero已经用事实证明了一件事:让AI从规则出发、从规律出发,找到属于自己的方式,才能抵达人类想象之外的境界。
三、物理AI的“AlphaZero时刻”
那么,物理AI的“规则”是什么?
是物理定律。是牛顿定律,是麦克斯韦方程组,是固体力学、流体力学、电动力学、热力学——这些支配着万事万物运转的第一性原理。
世界是可被模拟的,因为世界是有模型的。这个模型,就是物理规律本身。

真正的物理AI,不应该局限在“模仿”的框架里。它应该被赋予物理世界的规则——重力怎么作用、摩擦力怎么产生、物体碰撞如何传递能量——然后让它在这个规则体系里积累经验,并最总找到自己的答案。
AlphaZero不知道“定式”是什么、不知道“棋形”是什么,但它知道围棋的规则——黑白交替落子、气尽提子、终局数空——然后在这个规则下,下出了人类从未想过的棋路。
物理AI也应该如此。它不需要知道“人怎么倒水”“人怎么叠衣服”“人怎么拧螺丝”。它需要知道的是:水的流体力学特性是什么、织物的材料力学参数是什么、螺丝的螺纹几何和扭矩关系是什么。然后,在仿真环境中,基于这些物理规则,去探索属于自己的执行方式。
那种方式可能不像人,但比人更高效。
四、仿真:物理AI的“棋盘“
AlphaZero之所以能从零开始学下棋,是因为围棋的规则清晰、完备、可计算。每一手棋的落子、每一局的胜负,都可以在规则的框架内被精确推演。
物理AI也需要这样一个“棋盘”。这个棋盘就是仿真。
仿真将整个世界以物理方程的形式呈现,再通过求解器将其转化为可计算的数字结果。在仿真环境里,物理AI可以像AlphaZero自我对弈一样,在虚拟世界中反复试错、不断迭代,基于物理规律生成海量符合真实世界法则的训练数据。

这种路径的意义在于:物理AI不再依赖“手把手”的老师,而是在物理规律的“课堂”上自我学习。因此,我们在未来很可能看到,管道检修机器人的运动方式更像蛇而不是人。
从AlphaGo到AlphaZero,人工智能完成了一次认知范式的跃升——从模仿人类经验到遵从底层规则。
今天的物理AI,正站在同样的十字路口。