基于自监督音视频融合的无人机轨迹估计与分类——AV-DTEC
声音
2024-12-24 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
小型无人机的使用日益增加,已对公共安全构成严重威胁,而传统无人机检测系统往往笨重且成本高昂。为此,我们提出了AV-DTEC,这是一个基于自监督音视频融合的轻量级反无人机系统。AV-DTEC使用自监督学习进行训练,标签由激光雷达生成,同时通过平行选择状态空间模型学习音频和视觉特征。通过学习到的特征,设计了一个专门的即插即用主辅特征增强模块,将视觉特征融合到音频特征中,以提高在不同照明条件下的鲁棒性。为减少对辅助特征的依赖并实现模态对齐,我们提出了一种教师-学生模型,用于自适应调整视觉特征的权重。AV-DTEC在实际多模态数据上表现出卓越的准确性和有效性。代码和训练好的模型已公开访问于GitHub \url{https://github.com/AmazingDay1/AV-DETC}。
引用
@article{arxiv.2412.16928,
title = {AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification},
author = {Zhenyuan Xiao and Yizhuo Yang and Guili Xu and Xianglong Zeng and Shenghai Yuan},
journal= {arXiv preprint arXiv:2412.16928},
year = {2024}
}
备注
Submitted to ICRA 2025