TAIL: 文本-音频增量学习
声音
2025-07-29 v2 人工智能
计算机视觉与模式识别
音频与语音处理
摘要
许多研究结合文本和音频来捕捉多模态信息,但它们忽略了模型在新数据集上的泛化能力。引入新数据集可能会影响原始数据集的特征空间,导致灾难性遗忘。同时,大规模模型参数会显著影响训练性能。为解决这些局限,我们引入了一种名为文本-音频增量学习(TAIL)的新任务,用于文本-音频检索,并提出了一种新方法 PTAT(用于音频-文本增量学习的提示调优)。该方法利用提示调优来优化模型参数,同时结合音频-文本相似度和特征蒸馏模块来有效缓解灾难性遗忘。我们在 AudioCaps、Clotho、BBC Sound Effects 和 Audioset 数据集上对我们的方法和先前的增量学习方法进行了基准测试,我们的方法显著优于先前方法,特别是在对旧数据集的遗忘抵抗方面表现更强。与全参数微调(Sequential)方法相比,我们模型仅需要 2.42% 的参数,却实现了 4.46% 的性能提升。
引用
@article{arxiv.2503.04258,
title = {TAIL: Text-Audio Incremental Learning},
author = {Yingfei Sun and Xu Gu and Wei Ji and Hanbin Zhao and Yifang Yin and Roger Zimmermann},
journal= {arXiv preprint arXiv:2503.04258},
year = {2025}
}
备注
6 figures, 4 tables