中文

评估音频表示与音色相似度评级的对齐性

声音 2025-07-11 v1 音频与语音处理

摘要

心理声学所谓“音色空间”通过多维标度将乐器声音的感知相似度评级映射到低维嵌入,但存在可扩展性问题且无法泛化。近期在音频(音乐和语音)质量评估及图像相似度方面的结果表明,深度学习能够产生与人类感知良好对齐的嵌入,且 largely 免除上述限制。虽然现有人类评级音色相似度数据规模不足以训练深度神经网络(仅2614组两两评级,涉及334个音频样本),但可作为测试数据用于音频模型。本文引入指标,通过比较嵌入距离的绝对值和排序与人类相似度评级的对齐程度来评估多样化音频表示与人类音色相似度判断的匹配度。我们的评估涉及三种信号处理基于表示、十二种来自预训练模型的表示,以及三种来自新型声音匹配模型的表示。在其中,受图像风格迁移启发的风格嵌入、来自CLAP模型的嵌入以及声音匹配模型的嵌入,显著优于其他模型,显示其在建模音色相似度方面的潜力。

关键词

引用

@article{arxiv.2507.07764,
  title  = {Assessing the Alignment of Audio Representations with Timbre Similarity Ratings},
  author = {Haokun Tian and Stefan Lattner and Charalampos Saitis},
  journal= {arXiv preprint arXiv:2507.07764},
  year   = {2025}
}

备注

Accepted to ISMIR 2025