具身新贵昆仑行斩获WorldArena单项冠军全球亚军,世界模型全面领先

2026具身智能黑马玩家昆仑行机器人,全面领先全球权威榜单WorldArena。
据媒体报道,具身智能领域的权威评测WorldArena 2.0 Track 1发布了最新成绩,昆仑行机器人研发的昆仑世界模型GeWu,以69.58分的成绩,斩获图像质量(Image Quality)单项冠军,同时以65.91的综合得分,获得全球榜单亚军。模型在物理一致性(Physics Adherence)、可控性(Controllability)等多项关键能力维度上实现大幅领先,是本次77支参赛模型里,唯一一个在6大评测维度中,获得其中4项前4名次的模型,体现出极强的综合能力。
作为世界模型赛道的权威评测基准,WorldArena由国际顶尖高校及科研机构联合共建,WorldArena 2.0在1.0的基础上构建全面基准,从模态、功能、平台三大关键维度扩展具身世界模型评估。本次评测的WorldArena Track 1赛道,聚焦具身智能模型的基础核心能力,重点考核模型“看得准、猜得对、画面真实合理”的核心素养,突出模型在物理因果上的合理性。
考核标准严苛,专业度拉满,WorldArena Track 1吸引了全球几乎所有顶尖世界模型研发团队同台竞技,每一次榜单更新都代表着全球具身世界模型领域的最高技术水准,被誉为具身世界模型的“国际竞技场和权威试金石”。
在本次激烈的全球同台比拼中,昆仑行短时间内便完成模型训练、优化和多次迭代,作为昆仑世界模型(Kunlun World Model)的第一代版本,初次亮相即实现全面领先,尤其是在物理一致性(Physics Adherence)和可控性(Controllability)核心能力上的优秀表现,展现出昆仑行研发团队对世界模型物理因果的深刻理解和架构创新。
昆仑世界模型:遵循物理因果的世界模拟器
业内已逐渐形成共识,一个优秀的具身机器人大脑,并不能只简单地模拟动作;更关键在于它能不能理解真实的物理世界,尤其要严格地遵循物理因果关系。
在这样的背景下,“世界模型”成为了当下最热门的概念。在具身领域,世界模型扮演了不同的角色。它可以基于用户的输入,“渲染”出相当真实的画面;也可以基于某种转移模型,“模拟”状态的变化;还可以反过来,给定当前的观测和未来的目标,“规划”智能体的动作。
昆仑行认为,在具身智能领域,一个真正理解物理因果的世界模型,不能局限于“渲染”——即生成视觉上真实但物理上不可靠的视频——世界模型必须具备模拟器的能力:理解真实世界的物理因果,忠实地预测“如果执行某个动作,世界会如何变化”。模拟是世界模型最关键的能力。掌握了模拟,世界模型才有可能具备规划的能力;反过来则不行。
因此,基于「物理因果」的第一性原理,是昆仑世界模型架构设计的基本原则。
基于因果关系的模型架构
有别于业内主流的按照“文本归文本、视觉归视觉、动作归动作”的模态拆分的方式,昆仑世界模型将视野放在一个经常被忽视、但至关重要的深层结构上——因果关系。
昆仑世界模型不按模态拆分,而是按因果图中的角色语义,将模型拆为三座参数独立的Transformer塔(Tower):Tower 1负责Intent(目的),以自回归方式编码语言指令和场景理解,确定“要做什么”;Tower 2负责Intervention(干预),以flow matching范式建模动作序列,确定“怎么做”;Tower 3负责Consequence(响应),同样基于flow matching生成未来视频帧,呈现“做了之后会发生什么”。
三座塔共享decoder基础结构,但每层拥有独立的投影矩阵、前馈网络和归一化参数。

昆仑世界模型的架构图
这一拆分的关键价值体现在塔间的信息流控制上。昆仑世界模型通过联合因果注意力机制(United Causal Attention),在三塔之间施加严格的单向可见性约束:Tower 2可以看到Tower 1,但不能看到Tower 3;Tower 3可以同时看到Tower 1和Tower 2。
这意味着“行动决策”可以参考“任务目的”,但不能偷看“尚未发生的视觉后果”;而“视频渲染”需要同时知道“要做什么”和“怎么做”,才能生成物理因果上合理的画面。
消融实验印证了这一设计的必要性:一旦切断其中任意一条注意力通路,模型便会迅速从“因果仿真”退化为“默写模式”——它不再依据具体动作推演物理后果,而是直接将任务描述映射到训练集中最相似的视频片段,产生违背物理规律的画面(如物体在无对应动作的情况下自行运动)。这一退化在评估模型物理合理性的核心维度交互质量(Interaction Quality)上表现得尤为明显:切断其中一条因果通路后,交互质量急剧下降,物体不能严格遵循末端夹爪的操作,接触后的行为表现不符合物理规律。昆仑世界模型在这个维度上取得了82.40的高分,正是因果架构发挥作用的直接体现。
以“挂杯子”任务为例。如果切断Tower 3和Tower 2的因果通路,也就是说,视频生成时只看文本不看动作,操作对象就会出现不合理的运动。我们的消融实验证实了这个结论。
消融实验。输入任务描述:“Use your left arm to grab the drinking mug with smooth body,rotate it,set it down,then hang on the angular rack with slanted support rod”。(左侧)切断动作和视频的因果通路,机械臂的运动没有遵循给定轨迹;并且在挂上去的瞬间,杯子自行运动,明显违反物理规律。(右侧)在我们的终版模型中,Tower 3既看文本也看动作,预测视频遵循动作轨迹,杯子的位置变化合理。
三塔架构还天然支持多任务的统一推理。借鉴UniDiffuser的思想——“作为条件”与“作为生成目标”不过是同一去噪过程在不同噪声水平下的两端——通过调整各塔的噪声参数,同一套架构和权重即可在世界模拟、策略推理、联合预测等多种模式之间灵活切换。当动作塔和视频塔同时处于生成状态时,昆仑世界模型采用异步调度策略,让动作塔的去噪进度始终领先于视频塔,确保视频生成看到的动作信息始终更干净、更可靠。
面对长时序视频生成的需求,昆仑行研发团队设计了Chunk-wise自回归方案:长视频被拆分为多个片段逐段生成,核心挑战在于后续片段的上下文缺失。
为此,昆仑世界模型引入了仿生记忆采样策略——模仿人类记忆的衰减规律,近端帧高密度保留以维持运动连续性,远端帧稀疏采样以保留任务全局进度。配合绝对时序位置编码和帧率自适应放缩机制,模型在所有生成阶段都能准确感知物理时间位置,并灵活控制动作节奏。
仿生记忆的消融实验。输入任务描述:“Take the bottle with green cap with arms,put it in the dustbin with white inner bag,repeat the same for the transparent bottle and the rounded bottle with a white neck”。(左侧)不加入记忆机制,随时间推移,出现物体凭空消失、形变等现象,背景噪点也在不断累积。(右侧)模型加入仿生记忆采样策略,chunk间衔接流畅,长时序下稳定保持物体和背景的一致性。
最终,昆仑世界模型在WorldArena 2.0 Track 1基准测试中,以综合得分65.91获得全球亚军,并在图像质量单项上斩获冠军。并在多项核心能力指标上实现全面领先。
昆仑行机器人的模型研发负责人郝志会博士认为,“在研发昆仑世界模型的过程中,我们反复验证了一个核心判断:世界模型的架构设计应当尊重物理世界的因果结构。目的驱动行动,行动产生结果,这条因果链不仅是人类理解物理世界的基本框架,也应当成为模型架构的第一性原理。当归纳偏置对齐问题本质,我们看到了指标的提升,也看到了训练效率和泛化能力的同步改善”。
昆仑世界模型是昆仑行沿这一技术方向迈出的第一步。接下来,研发团队将在更复杂的任务场景中持续验证和扩展模型能力,并将昆仑世界模型应用于行为规划和仿真强化,推动世界模型从视觉渲染器进化为真正的物理智能基座。
关于昆仑行
昆仑行(Kunlunx AI)致力于打造面向物理世界的通用AI机器人。公司坚持"本体+大脑"双轮驱动战略,构建通用AI机器人本体、数据、小脑、大脑、智能体五位一体的全栈核心技术自研体系。我们相信物理因果是具身智能的第一性原理:不是模仿动作,而是理解世界。
公司打造以物理因果为核心的昆仑世界模型(KWM),让AI机器人真正像人一样学习、理解、进化,推动物理AI从实验室走向真实场景的规模化应用,让智能在物理世界中真正创造价值。
电观