4500秒:面向深度无人机音频分类的小数据训练方法
声音
2025-07-25 v1 人工智能
音频与语音处理
摘要
预计未来十年无人机 (UAV) 的使用将激增,这提高了对防范空域违规和安全威胁的安保措施的需求。本研究调查了用于 UAV 分类的深度学习方法,重点关注数据稀缺这一关键问题。为此,我们选择使用总计 4500 秒的音频样本训练模型,这些样本均匀分布在 9 个类别的数据集中。我们利用参数高效微调 (PEFT) 和数据增强来缓解数据稀缺问题。本文实现并比较了卷积神经网络 (CNNs) 和基于注意力的 Transformer 的使用。结果表明,CNNs 的准确率比 Transformer 高出 1-2%,同时计算效率更高。然而,这些早期发现指出了 Transformer 模型的潜力;表明随着更多数据和进一步优化,它们有可能超越 CNNs。未来的工作旨在扩大数据集规模,以更好地理解这些方法之间的权衡。
引用
@article{arxiv.2505.23782,
title = {4,500 Seconds: Small Data Training Approaches for Deep UAV Audio Classification},
author = {Andrew P. Berg and Qian Zhang and Mia Y. Wang},
journal= {arXiv preprint arXiv:2505.23782},
year = {2025}
}
备注
Accepted at the 14th International Conference on Data Science, Technology, and Applications (DATA), 2025