MAD:面向高效驾驶世界模型的运动与外观解耦
计算机视觉与模式识别
2026-01-15 v1
摘要
近期的视频扩散模型能够生成逼真且时间连贯的视频,但在自动驾驶领域,它们作为可靠的世界模型仍存在不足,因为自动驾驶需要结构化的运动和物理一致的交互。将这些通用视频模型适配到驾驶领域已展现出潜力,但通常需要海量的领域特定数据和昂贵的微调。我们提出了一种高效的适配框架,仅需极少的监督即可将通用视频扩散模型转换为可控的驾驶世界模型。其核心思想是将运动学习与外观合成解耦。首先,将模型适配为以简化形式预测结构化运动:即骨架化智能体与场景元素的视频,使学习聚焦于物理与社会合理性。然后,复用同一骨干网络,以这些运动序列为条件合成逼真的 RGB 视频,有效地为运动“穿上”纹理与光照。这一两阶段过程镜像了推理-渲染范式:先推断动力学,再渲染外观。我们的实验表明,这种解耦方法极为高效:在适配 SVD 时,我们仅用不到 6% 的计算量便匹配了先前的 SOTA 模型。扩展至 LTX 后,我们的 MAD-LTX 模型超越了所有开源竞争对手,并支持一整套文本、自车和对象控制。项目页面:https://vita-epfl.github.io/MAD-World-Model/
引用
@article{arxiv.2601.09452,
title = {MAD: Motion Appearance Decoupling for efficient Driving World Models},
author = {Ahmad Rahimi and Valentin Gerard and Eloi Zablocki and Matthieu Cord and Alexandre Alahi},
journal= {arXiv preprint arXiv:2601.09452},
year = {2026}
}