利用主动学习高效标注生物声学声音事件的聚合策略
声音
2025-03-05 v1 机器学习
音频与语音处理
摘要
在声音事件检测(SED)应用中收集的大量音频数据需要高效的标注策略以实现监督学习。人工标注昂贵且耗时,这使得主动学习(AL)成为减少标注工作量的有效途径。我们引入了 Top K Entropy,一种用于主动学习的新型不确定性聚合策略,该策略优先考虑音频录制中最不确定的片段,而不是对所有片段的不确定性取平均值。这种方法能够选择整段录制内容进行标注,提高了稀疏数据场景下的效率。我们将 Top K Entropy 与随机采样和 Mean Entropy 进行了比较,结果表明较少的标签即可达到相同的模型性能,特别是在声音事件稀疏的数据集中。评估在包含狐獴、狗和婴儿哭泣声音事件的公园录音混合音频上进行,代表了真实的生物声学监测场景。使用 Top K Entropy 进行主动学习,仅需 8% 的标签即可获得与在全标注数据集上训练相当的性能。Top K Entropy 优于 Mean Entropy,这表明让最不确定的片段代表整个音频文件的不确定性是最佳选择。研究结果突显了主动学习在音频和时间序列应用(包括生物声学)中实现可扩展标注的潜力。
引用
@article{arxiv.2503.02422,
title = {Aggregation Strategies for Efficient Annotation of Bioacoustic Sound Events Using Active Learning},
author = {Richard Lindholm and Oscar Marklund and Olof Mogren and John Martinsson},
journal= {arXiv preprint arXiv:2503.02422},
year = {2025}
}