中文

通过 3D 部件引导的视觉数据增强实现细粒度车辆感知

计算机视觉与模式识别 2021-01-07 v2

摘要

通过视觉感知模型整体理解物体及其 3D 可动部件,对于使自主智能体与世界交互至关重要。对于自动驾驶,车门、后备箱与引擎盖等车辆部件的动态与状态可提供有意义的语义信息与交互状态,对保障自动驾驶车辆安全必不可少。现有视觉感知模型主要关注粗粒度解析,如物体边界框检测或姿态估计,很少应对此类情形。本文通过解决三个关键问题来应对这一重要的自动驾驶问题。首先,为处理数据稀缺,我们提出一种有效的训练数据生成流程:将带动态部件的 3D 汽车模型拟合至真实图像中的车辆,再重建人-车交互(VHI)场景。我们的方法完全自动、无需任何人工交互,可生成大量处于不常见状态(VUS)的车辆用于训练深度神经网络(DNNs)。其次,为执行细粒度车辆感知,我们提出用于 VUS 解析的多任务网络与用于 VHI 解析的多流网络。第三,为定量评估我们数据增强方法的有效性,我们构建了首个真实交通场景中的 VUS 数据集(例如上车/下车或放置/取走行李)。实验结果表明,我们的方法在 2D 检测与实例分割上大幅领先其他基线方法(超过 8%)。此外,我们的网络在发现与理解这些不常见案例上带来巨大改进。我们已在 Github(https://github.com/zongdai/EditingForDNN)上发布源代码、数据集与训练模型。

关键词

引用

@article{arxiv.2012.08055,
  title  = {Fine-Grained Vehicle Perception via 3D Part-Guided Visual Data Augmentation},
  author = {Feixiang Lu and Zongdai Liu and Hui Miao and Peng Wang and Liangjun Zhang and Ruigang Yang and Dinesh Manocha and Bin Zhou},
  journal= {arXiv preprint arXiv:2012.08055},
  year   = {2021}
}