基于环境表征的选择性记忆元学习用于声事件定位与检测
音频与语音处理
2024-10-08 v3 声音
摘要
环境变化和冲突给基于学习的声事件定位与检测(SELD)方法带来了重大挑战。SELD系统在特定声学环境下训练时,通常对多样声学环境的泛化能力有限。此外,获取空间声事件的标注样本成本高昂。在新环境中部署SELD系统需要大量时间进行重新训练和微调。为克服这些挑战,我们提出环境自适应Meta-SELD,旨在利用最少数据高效适应新环境。我们的方法专门利用计算合成的空间数据,并在预训练的与环境无关的模型上采用模型无关元学习(MAML)。然后,该方法利用来自相应环境的有限样本,快速适应未见过的真实世界环境。受“学会遗忘”方法的启发,我们引入选择性记忆概念作为跨环境冲突解决策略。该方法通过选择性记忆与目标环境相关的信息,并通过模型参数的选择性衰减来适应新环境。此外,我们引入环境表征来描述不同的声学设置,增强衰减方法对各种环境的适应性。我们在Sony-TAu真实空间声景2023(STARSS23)数据集开发集和计算合成场景上评估了所提方法。实验结果表明,与传统的监督学习方法相比,所提方法在定位方面表现更优。
引用
@article{arxiv.2312.16422,
title = {Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection},
author = {Jinbo Hu and Yin Cao and Ming Wu and Qiuqiang Kong and Feiran Yang and Mark D. Plumbley and Jun Yang},
journal= {arXiv preprint arXiv:2312.16422},
year = {2024}
}
备注
14 pages, 11 figures, accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)