中文

VideoWeaver: 面向具身智能体的多模态多视角视频到视频转换

计算机视觉与模式识别 2026-03-27 v1

摘要

近期视频到视频(V2V)转换的进展使得具身AI演示的真实重模拟成为可能,这一能力允许预训练的机器人策略在新环境中迁移而无需额外数据采集。然而,先前的研究每次只能处理单个视角,而具身AI任务通常由多个同步相机拍摄,以支持策略学习。将单视角模型简单独立地应用于每个相机会导致视角间外观不一致,而标准Transformer架构由于跨视角注意力的二次代价而无法扩展到多视角设置。我们提出了VideoWeaver,第一个多模态多视角V2V转换框架。VideoWeaver最初作为单视角基于流的V2V模型进行训练。为了扩展到多视角设置,我们提出将所有视角锚定在由前馈空间基础模型Pi3导出的共享四维潜在空间中。这鼓励了即使在宽基线和动态相机运动下也保持视角一致的外观。为了超越固定数量的相机,我们在不同的扩散时间步训练视角,使模型能够学习联合和条件视角分布。这反过来又允许以现有视角为条件自回归合成新视角。实验表明,在单视角转换基准测试上取得了优于或相当于最先进的性能,并且首次实现了物理和风格一致的多视角转换,包括对机器人学习的世界随机化至关重要的具有挑战性的自我中心和多相机异构设置。

关键词

引用

@article{arxiv.2603.25420,
  title  = {VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents},
  author = {George Eskandar and Fengyi Shen and Mohammad Altillawi and Dong Chen and Yang Bai and Liudi Yang and Ziyuan Liu},
  journal= {arXiv preprint arXiv:2603.25420},
  year   = {2026}
}