MVP:用于驾驶动作定位的鲁棒多视角实践
计算机视觉与模式识别
2022-07-06 v1
摘要
分心驾驶每年导致数千人死亡,如何应用深度学习方法预防这些悲剧已成为一个关键问题。在第六届AI City挑战赛的Track3中,研究者提供了一个带有密集动作标注的高质量视频数据集。由于数据规模小且动作边界不清晰,该数据集对精确局部化所有不同动作并分类其类别提出了独特挑战。在本文中,我们充分利用视频间的多视角同步,并进行鲁棒的多视角实践(MVP)用于驾驶动作定位。为避免过拟合,我们以Kinetics-700预训练微调SlowFast作为特征提取器。然后将不同视角的特征传入ActionFormer以生成候选动作提议。为精确局部化所有动作,我们设计了精细的后处理,包括模型投票、阈值过滤与重复去除。结果表明,我们的MVP对驾驶动作定位具有鲁棒性,在Track3测试集上取得了28.49%的F1-score。
引用
@article{arxiv.2207.02042,
title = {MVP: Robust Multi-View Practice for Driving Action Localization},
author = {Jingjie Shang and Kunchang Li and Kaibin Tian and Haisheng Su and Yangguang Li},
journal= {arXiv preprint arXiv:2207.02042},
year = {2022}
}