中文

基于运动序列的多视角驾驶场景可控行人视频编辑

计算机视觉与模式识别 2025-08-04 v1 人工智能 机器人学

摘要

自动驾驶系统中的行人检测模型常因训练数据集中缺乏危险行人情景而缺乏鲁棒性。为解决这一限制,我们提出了一种集成视频填充和人类运动控制技术的用于多视角驾驶场景的可控行人视频编辑框架。我们的方法从多个摄像头视角中识别行人感兴趣区域,将检测边界框按固定比例扩大,并对这些区域进行调整和拼接,以保持跨视角的空间关系。然后应用二进制掩码指定可编辑区域,行人编辑由姿态序列控制条件在其中引导。这使得包括行人插入、替换和删除在内的灵活编辑功能成为可能。广泛的实验表明,我们的框架在保持高质量的行人编辑方面表现出强烈的视觉逼真度、时空一致性和跨视角一致性。这些结果表明,所提出的方法是一种稳健且多功能的多视角行人视频生成解决方案,具有广泛的潜在应用前景,可用于数据增强和场景仿真。

关键词

引用

@article{arxiv.2508.00299,
  title  = {Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence},
  author = {Danzhen Fu and Jiagao Hu and Daiguo Zhou and Fei Wang and Zepeng Wang and Wenhua Liao},
  journal= {arXiv preprint arXiv:2508.00299},
  year   = {2025}
}

备注

ICCV 2025 Workshop (HiGen)