中文

共演化潜在动作世界模型

机器学习 2026-04-07 v2

摘要

将预训练的视频生成模型通过潜在动作转化为可控的世界模型是通往通用世界模型的有前景的步骤。主导性的方法采用两阶段方法,分别训练潜在动作模型 (LAM) 和世界模型,导致冗余训练并限制其潜在的共适应潜力。一个概念上简单且引人注目的想法是直接用强大的世界模型取代 LAM 中的前向动态模型并联合训练,但这在表征上容易导致崩溃。本文提出 CoLA-World,首次成功实现了这一协同范式,通过关键的预热阶段有效地对齐从零训练的 LAM 与预训练世界模型的表征,解决了联合学习的核心挑战。这开启了一个共演化循环:世界模型充当有经验的导师,提供梯度以塑造高质量的 LAM,而 LAM 则提供更精确和可适应的控制界面与世界模型协同作用。实验上,CoLA-World 在视频仿真质量和下游视觉规划方面与先前的两阶段方法相比甚至优于,确立了该领域的稳健且高效的新范式。

关键词

引用

@article{arxiv.2510.26433,
  title  = {Co-Evolving Latent Action World Models},
  author = {Yucen Wang and Fengming Zhang and De-Chuan Zhan and Li Zhao and Kaixin Wang and Jiang Bian},
  journal= {arXiv preprint arXiv:2510.26433},
  year   = {2026}
}