AV-PedAware:用于动态行人感知的自监督音视频融合
机器人学
2025-04-07 v2
摘要
本研究提出 AV-PedAware,一个用于提升机器人应用中动态行人感知能力的自监督音视频融合系统。行人感知是许多机器人应用中的关键需求。然而,传统依赖相机和激光雷达覆盖多视角的方法成本高昂,且易受光照变化、遮挡和天气条件等因素的影响。我们提出的方案通过低成本的音频与视觉融合来模拟人类感知,实现三维行人检测。本研究首次尝试利用音视频融合来监测脚步声,以预测附近行人的运动。该系统通过基于激光雷达生成标签的自监督学习进行训练,使其成为激光雷达行人感知的一种低成本替代方案。AV-PedAware 以远低于激光雷达系统的成本取得了可比的结果。通过利用注意力机制,该系统能够应对动态光照和遮挡,克服了传统激光雷达和相机系统的局限性。为评估本方法的有效性,我们收集了一个新的多模态行人检测数据集,并进行了实验,结果表明该系统仅使用音频和视觉数据即可提供可靠的三维检测结果,即使在极端视觉条件下也是如此。我们将把所收集的数据集和源代码在线公开,以鼓励机器人感知系统领域的进一步发展。
引用
@article{arxiv.2411.06789,
title = {AV-PedAware: Self-Supervised Audio-Visual Fusion for Dynamic Pedestrian Awareness},
author = {Yizhuo Yang and Shenghai Yuan and Muqing Cao and Jianfei Yang and Lihua Xie},
journal= {arXiv preprint arXiv:2411.06789},
year = {2025}
}
备注
This work has been accepted for publication at the 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). Personal use is permitted. For other uses, permission from IEEE is required