知晓自身无知的世界模型——基于校准不确定性的可控视频生成
计算机视觉与模式识别
2026-03-12 v2 人工智能
机器人学
摘要
最近的生成式视频模型研究取得了在高保真度视频合成方面的重大突破,特别是在可控视频生成方面,该技术将生成的视频条件化于文本和动作输入,例如在指令导向的视频编辑和机器人世界建模中。尽管具备卓越的能力,但可控视频模型常会幻觉——生成与物理现实不一致的未来视频帧,这在诸多任务中引发严重担忧,如机器人策略评估和规划。然而,现有的顶级视频模型缺乏评估和表达自身置信度的能力,这妨碍了幻觉的缓解。为严格解决此挑战,我们提出C3方法,这是一种用于训练连续尺度校准可控视频模型的不确定性量化(UQ)方法,实现对每个生成视频帧中亚网格级稠密置信度估计,精确定位视频帧中的不确定性。我们的UQ方法引入了三个核心创新,以使视频模型能够估计其不确定性。首先,我们的方法开发了通过严格的评分规则训练视频模型以实现正确性和校准。其次,我们在潜在空间中估计视频模型的不确定性,避免了像素空间方法所导致的训练不稳定和高昂的训练成本。最后,我们将稠密潜在空间不确定性映射到可解释的像素级不确定性于RGB空间,用于直观可视化,提供高分辨率不确定性热图,识别不可信任的区域。通过在大规模机器人学习数据集(Bridge 和 DROID)上的大量实验和实际评估,我们展示了该方法不仅在训练分布内提供校准的不确定性估计,而且能够有效进行分布外检测。
引用
@article{arxiv.2512.05927,
title = {World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty},
author = {Zhiting Mei and Tenny Yin and Micah Baker and Ola Shorinwa and Anirudha Majumdar},
journal= {arXiv preprint arXiv:2512.05927},
year = {2026}
}