视频号
    标题 摘要 内容
    详情

    01

    贾奎担任中国电子学会世界模型专家委员会首届委员


    世界模型作为人工智能领域的前沿方向,是具备对物理世界因果理解与未来推演能力的智能系统,是机器人“看懂世界”和“改变世界”的关键技术底座。为深入贯彻党和国家关于推动人工智能高质量发展的重大决策部署,认真落实“十五五”规划纲要中关于前瞻布局未来产业的有关要求,8月21日下午,中国电子学会在2026世界机器人大会上正式宣布成立世界模型专家委员会(以下简称专委会)


    图片


    跨维智能创始人兼CEO贾奎受聘担任中国电子学会世界模型专家委员会首届委员,并出席专委会成立后的首次闭门会议。会上,中国电子学会副理事长兼秘书长、总部党委书记赵云峰与专委会主任委员王坚院士共同为首届委员颁发聘书


    图片
    图片



    02

    WRC主论坛共话世界模型

    Physical Token经济学引发现场共鸣


    同期,贾奎参加主论坛“世界模型到服务人类的现实距离”主题对话。该环节由王坚院士主持,贾奎与中国电子学会世界模型专委会委员围绕世界模型的核心能力、数据成本及现实应用展开探讨,并分享了Physical Token经济学的思考,引发王坚院士及现场嘉宾共鸣


    图片


    (以下内容根据速记资料整理)


    王坚:最近几年世界模型这个词比较热,是不是能够谈一下你们所认识的世界模型跟其他模型有什么不一样的地方,当前有哪些非常有意思的技术路线?


    贾奎:这一轮AI热潮,从Transformer、大语言模型,发展到图像生成、视频生成、3D生成,再到今天讨论的世界模型。可以说,世界模型代表了过去六七年生成式AI发展的一个阶段性高潮。


    无论是从状态预测还是内容生成的角度,世界模型追求的都是生成一个在三维几何和物理规律上准确、完整的世界。因此,从这个意义上说,世界模型是生成式AI皇冠上的明珠。


    广义来看,视频生成、3D生成,以及对几何和物理世界的建模,都可以被纳入世界模型的范畴。但跨维智能更关注的是:世界模型能否生成一个三维几何正确、符合物理规律、动态且可交互的环境。


    要实现这一点,世界模型的隐空间和Token就需要建立在正确的时空节点之上。它不仅要能够生成机器人末端执行器完成任务的合理运动轨迹,还要能够预测机器人或其他物理智能体与环境交互后,环境会发生怎样的动态变化。


    因此,与大语言模型或VLA相比,世界模型的能力上限更高,但对数据规模和质量的要求也更大。我们期待未来五到十年,世界模型能够取得更大的突破。


    图片


    王坚:真正能够服务人类的世界模型,应该具备哪些核心能力?目前最大的差距是什么?


    贾奎:讨论世界模型如何服务人类,首先要看人类真正需要什么。概括来说,人的需求主要有两个方面:一方面是获得情绪价值,有优质的内容可以体验;另一方面是从劳动中解放出来,希望机器人能够真正帮助人完成工作。


    这也对应了人工智能长期以来的两条研究主线:一条是感知与理解,另一条是重建与生成。如果未来能够形成一个大一统的世界模型,它就可以生成一个在三维几何和物理规律上准确的世界。将这个世界投影到不同的信息形态上,就可以表现为文本、图片、视频或三维内容,从而服务于人类的内容创作与精神需求。


    另一方面,我们也希望世界模型能够感知和理解真实环境,进而驱动机器人及其他物理智能体行动。无论是在工厂中将人从重复性劳动中解放出来,还是进入家庭、理解人的意图,判断不同任务应该如何操作,最终真正帮助人类,都需要世界模型提供支撑。


    因此,我们将世界模型视为AI走向大一统的一种终局形态:它既能够感知、理解并生成符合物理规律的世界,也能够驱动智能体在这个世界中完成任务。当前最大的差距,正在于这两类能力还没有真正统一起来——模型不仅要生成内容,还要准确理解三维物理世界、预测交互带来的变化,并将这些认知转化为可靠的行动。从科学研究的角度看,这也可能是未来至少十年,人工智能、机器学习乃至统计学共同面对的一项长期命题。


    图片


    王坚:数据会不会成为创新企业不可逾越成本的障碍,有没有机会大家共建把数据做好,想听听大家在这个行业里的建议和经验。


    贾奎:刚才有嘉宾提到,当前AI的发展仍然很大程度上依赖数据规模、模型参数和算力的持续投入。但如果我们的目标是通用物理AI或通用具身智能,那么行业可能仍然远远低估了“通用”对数据的需求。


    一个很简单的例子是:面对一两个物体,人就可以设计出近乎无穷的任务,而每项任务又对应不同的动作。任务空间几乎是无限的,因此,我们必须找到一种全社会能够负担的数据生产方式。


    这也是我最近在行业里推动“Physical Token经济学”思考的原因。它讨论的不是一个Physical Token卖多少钱,而是要从一开始就系统思考:数据基础设施如何建设、模型架构如何设计,以及模型、本体与应用场景之间如何协同。如果不在产业早期把这些问题想清楚,通用物理AI可能很难真正实现,而这最终仍然会回到数据成本的问题。


    从通用能力来看,我认为机器人的泛化能力由两部分耦合而成:一是语义泛化,二是物理泛化


    语义泛化解决的是,机器人面对不同对象时,能否理解应该完成什么任务、采取什么动作。它本质上来自人类认知以及认知之后形成的行为智能,因此,这部分能力必须从真实的人类数据中学习。但真实数据也必须以足够高效、低成本的方式获取。


    传统的真机采集既昂贵又低效。即便采用Ego-Human、Ego-UMI等第一视角采集方式,一个人每天通常也只能采集500至1000条数据。具身智能需要借鉴自动驾驶和大语言模型的数据范式:人们每天自然地开车、使用手机、打字、拍照和拍视频,在正常活动中就能持续产生海量数据。因此,具身智能也需要找到一种不影响人们工作和生活、能够近乎无额外成本地获取人类行为与经验的方法。例如,通过裸手、第一视角等方式,让数据在人类正常活动过程中自然产生。


    但这类数据主要帮助机器人理解“动作应该怎么做”,还不足以保证执行的精度和稳定性。要让机器人进入真实场景并持续可靠地工作,还需要高效的后训练来解决物理泛化问题,也就是当测试环境、物体状态或物理条件发生变化时,机器人仍然能够稳定完成任务。


    跨维智能一直坚持利用合成数据和生成式仿真进行后训练。因为只有当后训练得到的模型能够直接部署到机器人上,并实现高成功率、高精度和高稳定性,企业才不需要进入每个现场重新采集大量数据。最终,客户是否愿意为机器人投入,取决于其带来的效率提升与综合价值。如果每落地一个场景都需要承担高昂的采集和调试成本,商业上就难以成立。从第一性原理出发,我们必须追求更高效的后训练数据生产方式,而生成式仿真和合成数据正是解决物理泛化问题的重要路径。


    因此,我们希望形成这样一套闭环:预训练阶段低成本获取人类经验,学习语义和行为;再通过生成式仿真与合成数据完成后训练,提升执行的精度与稳定性;最后由世界模型驱动机器人进入不同应用场景,在真实部署中持续产生并回流数据,让数据飞轮像自动驾驶一样运转起来。只有这样,世界模型驱动的物理AI才有机会实现可持续、规模化落地。


    王坚:希望你们用一句话表达一下,为了实现你们的理想,自己当下最应该做的事情是什么?


    贾奎:我们希望与行业一起,把模型推向更多真实应用场景,真正为人类解决问题。


    王坚:谢谢各位嘉宾,感谢大家的分享。





    03

    亮相京东产业论坛

    Physical Token经济学再论规模化路径


    图片


    此外,贾奎还受邀出席世界机器人大会分论坛,京东智能机器人产业主题活动——以场景·链未来,贾奎围绕Physical Token经济学展开分享,从数据生产、模型训练到真实部署,进一步阐释通用物理AI降低新增能力边际成本、走向规模化应用的路径。


    图片


    此次WRC期间,跨维智能的技术思考从世界模型专家委员会延伸至主论坛与产业分论坛。围绕世界模型与Physical Token经济学,跨维智能始终坚持一个判断:世界模型的价值,不止于生成一个逼真的世界,更在于让机器人真正理解世界、作用于世界。


    面向通用物理智能的终局,跨维智能将继续打通人类经验、生成式仿真、模型训练与真实部署的完整闭环,让每一次落地都成为下一项能力生长的起点,持续降低物理智能的生产成本,推动机器人从“能够完成任务”走向可复制、可持续的规模化应用。