中文

探究预训练音频嵌入对常见音效的敏感性

机器学习 2025-01-28 v1

摘要

近年来,基础模型显著推动了数据驱动系统在各个领域的发展。然而,这些模型,尤其是作为特征提取器时的底层属性,仍有待探索。本文研究了从众多基础模型(包括 OpenL3、PANNs 和 CLAP)中提取的音频嵌入对音效的敏感性。我们聚焦于音效作为敏感性来源,由于其在大型音频数据集中的普遍存在。通过对音效进行参数化处理(增益、低通滤波、混响和位移),我们分析了嵌入空间中变形轨迹与音效强度之间的相关性。我们提出使用标准相关分析来量化由音效诱导的变形轨迹的维度和线性化程度。我们发现,存在一个方向沿该方向,嵌入随音效强度单调移动,但包含位移的子空间通常是高维的。这表明预训练音频嵌入不会对音效进行全局线性化。我们对仪器分类下游任务的实证结果确认,将估计的变形方向投射出后,通常无法提高预训练嵌入对音效的鲁棒性。

关键词

引用

@article{arxiv.2501.15900,
  title  = {Investigating the Sensitivity of Pre-trained Audio Embeddings to Common Effects},
  author = {Victor Deng and Changhong Wang and Gael Richard and Brian McFee},
  journal= {arXiv preprint arXiv:2501.15900},
  year   = {2025}
}