通过模型再平衡实现长尾识别
声音
2026-02-06 v2 人工智能
机器学习
音频与语音处理
摘要
长尾识别在深度学习中普遍且具有挑战性,甚至在基础模型的下游微调中亦如此,因为偏斜的类别分布通常会阻碍模型对尾部类别的泛化。尽管来自数据增强、损失再平衡和解耦训练等角度的先前方法虽有前景,但在诸如多标签长尾识别等广泛场景中实现持续改进困难。本研究深入探讨了长尾情境下模型容量的本质影响,提出一种新框架——模型再平衡 (MORE),通过直接重新平衡模型参数空间来缓解不平衡。具体而言,MORE 引入低秩参数组件,通过量身定制的损失和正弦重加权计划引导参数空间分配,但不增加整体模型复杂度或推理成本。针对跨多类和多标签任务的多样化长尾基准进行大量实验,表明 MORE 在尾部类别上显著改进泛化,有效补充现有的不平衡缓解方法。这些结果凸显了 MORE 在长尾场景下作为稳健的即插即用模块的潜力。
引用
@article{arxiv.2510.08176,
title = {Leveraging Whisper Embeddings for Audio-based Lyrics Matching},
author = {Eleonora Mancini and Joan Serrà and Paolo Torroni and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2510.08176},
year = {2026}
}
备注
Accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing)