中文

Panacea:面向自动驾驶的全景可控视频生成

计算机视觉与模式识别 2023-11-29 v1

摘要

自动驾驶领域日益需要高质量的标注训练数据。在本文中,我们提出 Panacea,一种在驾驶场景中生成全景可控视频的创新方法,能够产出数量无限、多样且带标注的样本,对自动驾驶发展至关重要。Panacea 解决了两个关键挑战:“一致性”与“可控性”。一致性确保时间与时序跨视角连贯,而可控性确保生成内容与相应标注对齐。我们的方法集成新颖的 4D 注意力与两阶段生成流水线以维持连贯性,并辅以 ControlNet 框架,通过鸟瞰图(BEV)布局实现精细控制。在 nuScenes 数据集上对 Panacea 的大量定性与定量评估证明了其在生成高质量多视角驾驶场景视频上的有效性。本工作通过有效扩充用于先进 BEV 感知技术的训练数据集,显著推动了自动驾驶领域的发展。

关键词

引用

@article{arxiv.2311.16813,
  title  = {Panacea: Panoramic and Controllable Video Generation for Autonomous Driving},
  author = {Yuqing Wen and Yucheng Zhao and Yingfei Liu and Fan Jia and Yanhui Wang and Chong Luo and Chi Zhang and Tiancai Wang and Xiaoyan Sun and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2311.16813},
  year   = {2023}
}

备注

Project page: https://panacea-ad.github.io/