中文

SpurAudio:用于研究少样本音频分类中捷径学习的基准

计算机视觉与模式识别 2026-05-14 v1

摘要

少样本分类(Few-shot classification, FSC)在从有限标注数据中学习方面被广泛应用,但大多数评估隐含地假设目标概念独立于上下文线索。在现实场景中,示例常常出现于丰富的上下文中,使得模型能够利用前景内容与背景信号之间的虚假相关性。在少样本图像分类中,这类效应已有所研究,但在少样本音频分类中其作用仍基本未被探讨,而现有音频基准对控制上下文结构的能力有限。我们引入SpurAudio基准,利用音频中前景事件与背景环境天然可分离性的特性,实现对支持集和查询集之间上下文迁移的受控、多层次评估。通过该基准,我们表明许多最先进的少样本方法在背景相关性被破坏时会出现严重的性能下降,尽管在标准评估协议下实现了相似的准确率。关键在于,这种脆弱性即便存在于大型预训练音频基础模型中,排除了背部容量不足的解释。此外,在常规基准下看起来相似的方法在面对虚假相关性时表现出明显不同的灵敏度,这揭示了特征表示如何在推理时与分类器头交互,从而导致算法在系统性优势和脆弱性方面的差异。这些发现为理解少样本方法在音频中的行为提供了新见解,并凸显了在评估FSC模型时,需要采用能显式探测上下文依赖性的基准测试的必要性。

关键词

引用

@article{arxiv.2605.13672,
  title  = {SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification},
  author = {Giries Abu Ayoub and Morad Tukan and Loay Mualem},
  journal= {arXiv preprint arXiv:2605.13672},
  year   = {2026}
}