中文

无标签音频对比学习模型的多一致性指导测试时适应

声音 2024-12-24 v1 计算机视觉与模式识别 音频与语音处理

摘要

预训练音频语言模型 (ALM) 的一个迷人之处在于其惊人的零样例通用能力以及旨在改善域性能而进行的测试时适应 (TTA) 方法。然而,之前的 TTA 方法在零样本分类中往往陷入错误的模型预测。为进一步提升性能,我们提出了在无标注标签下进行提示学习的多重指导。首先,设置对 ALM 背景标记和域标记一致性的指导。其次,设置对每个单个测试样本多个增强视图的一致性指导以及对不同测试样本之间的对比学习指导。第三,我们提出了相应的端到端学习框架,用于所提出的测试时适应方法。我们在跨域的 12 个下游任务上广泛评估了我们的方案,所提出的适应方法在与最先进模型相比时实现了 4.41%(最大 7.50%)的平均零样本性能提升。

关键词

引用

@article{arxiv.2412.17306,
  title  = {Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio},
  author = {Gongyu Chen and Haomin Zhang and Chaofan Ding and Zihao Chen and Xinhan Di},
  journal= {arXiv preprint arXiv:2412.17306},
  year   = {2024}
}

备注

6 pages, 1 figure, accepted by ICASSP 2025