中文

基于音频阵列与 LiDAR 伪标签的无人机三维轨迹估计

机器人学 2025-01-22 v5 声音 音频与语音处理

摘要

随着小型无人机(UAV)日益普及,人们对其公共安全和隐私影响的担忧日益增加,凸显了对先进跟踪和轨迹估计解决方案的需求。作为回应,本文引入了一种利用音频阵列进行无人机三维轨迹估计的新颖框架。我们的方法结合了自监督学习模型,首先将音频数据转换为 mel 频谱图,通过编码器对其进行分析以提取关键的时间和频谱信息。同时,通过无监督方法利用 LiDAR 点云估计无人机轨迹。这些基于 LiDAR 的估计作为伪标签,使得无需标注数据即可训练音频感知网络。在该架构中,基于 LiDAR 的系统作为教师网络,指导作为学生网络的音频感知网络。一旦训练完成,该模型可以仅使用音频信号独立预测三维轨迹,在部署期间无需 LiDAR 数据或外部真值。为了进一步提高精度,我们应用高斯过程建模来改进时空跟踪。我们的方法在 MMAUD 数据集上提供了顶级性能,在不依赖真值标注的情况下,利用自监督学习技术在轨迹估计中确立了新的基准。

关键词

引用

@article{arxiv.2412.12698,
  title  = {Audio Array-Based 3D UAV Trajectory Estimation with LiDAR Pseudo-Labeling},
  author = {Allen Lei and Tianchen Deng and Han Wang and Jianfei Yang and Shenghai Yuan},
  journal= {arXiv preprint arXiv:2412.12698},
  year   = {2025}
}

备注

Accepted for ICASSP