简化输入依赖的联合视听怠速车辆检测
计算机视觉与模式识别
2024-10-29 v1
摘要
怠速车辆检测(IVD)有助于监测和减少不必要的怠速,并可集成到实时系统中以解决由此产生的污染和有害产物问题。先前的方法[13]是一个非端到端模型,需要额外的用户点击来指定部分输入,这使得系统部署更容易出错甚至不可行。相比之下,我们引入了一个端到端的联合视听怠速车辆检测任务,旨在视觉上检测处于三种状态的车辆:移动、怠速和熄火。与视听车辆跟踪等特征共现任务不同,我们的怠速车辆检测任务处理的是互补特征,其中标签不能仅由单一模态确定。为此,我们提出了AVIVD-Net,这是一种通过双向注意力机制整合音频和视觉特征的新型网络。AVIVD-Net通过学习一个联合特征空间来简化输入过程,降低了先前方法的部署复杂性。此外,我们引入了AVIVD数据集,该数据集比先前数据集大七倍,为研究怠速车辆检测问题提供了显著更多的标注样本。我们的模型性能与先前方法相当,使其适用于自动化部署。此外,通过在特征共现公共数据集MAVD [23]上评估AVIVD-Net,我们展示了其扩展到自动驾驶车辆摄像头设置的潜力。
引用
@article{arxiv.2410.21170,
title = {Joint Audio-Visual Idling Vehicle Detection with Streamlined Input Dependencies},
author = {Xiwen Li and Rehman Mohammed and Tristalee Mangin and Surojit Saha and Ross T Whitaker and Kerry E. Kelly and Tolga Tasdizen},
journal= {arXiv preprint arXiv:2410.21170},
year = {2024}
}