中文

基于深度 2D-3D 前馈的单目行人朝向估计

计算机视觉与模式识别 2020-12-22 v2

摘要

自动驾驶中准确的行人朝向估计有助于自车获取相关环境中行人的意图,这些是碰撞避免和预警等安全措施的基础。然而,由于行人尺寸相对较小且形变程度高,常见的行人朝向估计模型难以从中提取充分且全面的信息,从而限制了其性能,尤其是无法获取物体及相关环境深度信息的单目模型。本文提出了一种新颖的单目行人朝向估计模型,称为 FFNet。除相机捕获外,该模型根据朝向与行人 2D 和 3D 尺寸之间的逻辑关系,将这两者作为另外两个输入。行人的 2D 和 3D 尺寸由相机捕获确定,并通过两条连接到朝向估计器的前馈链路进一步利用。前馈链路增强了所提模型网络结构的逻辑性与可解释性。实验表明,在相同的训练过程后,所提模型比大多数最先进模型至少有 1.72% 的 AOS 提升。该模型在 KITTI 数据集的朝向估计评估中也具有竞争力。

关键词

引用

@article{arxiv.1909.10970,
  title  = {Monocular Pedestrian Orientation Estimation Based on Deep 2D-3D Feedforward},
  author = {Chenchen Zhao and Yeqiang Qian and Ming Yang},
  journal= {arXiv preprint arXiv:1909.10970},
  year   = {2020}
}

备注

29 pages, 12 figures