利用基于深度学习的音频分类改善自动驾驶车辆的环境感知
声音
2022-09-12 v1 人工智能
音频与语音处理
摘要
听觉对于自动驾驶车辆(AVs)更好地感知周围环境至关重要。尽管AV的视觉传感器如相机、激光雷达与雷达有助于观测周围环境,但AV无法看到那些传感器视线之外。另一方面,AV的听觉不会被视线遮挡。例如,AV可通过音频分类识别紧急车辆的警笛声,即便该紧急车辆不在AV视线内。因此,听觉感知是对相机、激光雷达与基于雷达的感知系统的补充。本文提出一种基于深度学习的鲁棒音频分类框架,旨在实现AV的改善环境感知。所提框架利用深度卷积神经网络(CNN)对不同音频类别分类。使用城市环境数据集UrbanSound8k训练并测试所开发框架。从UrbanSound8k数据集中识别出七类音频,即空调、汽车喇叭、儿童玩耍、狗吠、引擎怠速、枪声与警笛,因其与AV相关。我们的框架能以97.82%准确率分类不同音频类别。此外,给出了全部十类的音频分类准确率,证明我们的框架在AV相关声音情形下优于现有音频分类框架。
引用
@article{arxiv.2209.04075,
title = {Improving the Environmental Perception of Autonomous Vehicles using Deep Learning-based Audio Classification},
author = {Finley Walden and Sagar Dasgupta and Mizanur Rahman and Mhafuzul Islam},
journal= {arXiv preprint arXiv:2209.04075},
year = {2022}
}