面向音频分类的领域增量学习
音频与语音处理
2024-12-24 v1
摘要
本文提出一种用于从不同声学条件下记录的序列数据集进行音频分类的领域增量学习方法。对模型进行一系列演化的领域或数据集的微调会导致先前学习知识的遗忘。另一方面,冻结模型的所有层会导致模型无法适应新领域。本文的 novel 动态网络架构保持了领域共享的均匀声学特征,并在增量步骤中学习领域特定的声学特征。我们的 approach 在保持先前学习领域知识和获取新领域知识之间取得了良好的平衡。我们在从欧洲城市和韩国的声学场景单标签分类以及从 Audioset 和 FSD50K 数据集的音频录音多标签分类方面展示了所提方法的有效性。该 method 在欧洲城市 -> 韩国的顺序下实现了 71.9% 的平均准确率,而在韩国 -> 欧洲城市的顺序下实现了 83.4% 的准确率。在多标签音频分类设置下,分别对 Audioset -> FSD50K 和 FSD50K -> Audioset 达到了 47.5% 和 40.7% 的平均 lwlrap。
引用
@article{arxiv.2412.17424,
title = {Domain-Incremental Learning for Audio Classification},
author = {Manjunath Mulimani and Annamaria Mesaros},
journal= {arXiv preprint arXiv:2412.17424},
year = {2024}
}
备注
Accepted to ICASSP 2025