中文

训练用于评估音乐对抗攻击中听觉相似度的感知模型

声音 2025-09-08 v1 音频与语音处理

摘要

音乐信息检索(MIR)系统极易受到通常人类无法察觉的对抗攻击,这主要是由于模型特征空间与人类听觉感知之间的错位。现有的防御措施和感知度量标准常常无法充分捕捉这些听觉上的细微差别,我们初步的听力测试结果支持了这一局限性,测试显示常用度量标准与人类判断之间的相关性较低。为了弥合这一差距,我们引入了感知对齐的MERT Transformer(PAMT),这是一个用于学习鲁棒、感知对齐的音乐表示的新颖框架。我们的核心创新在于心理声学条件化的序列对比Transformer,这是一个构建在冻结的MERT编码器之上的轻量级投影头。PAMT与主观评分的斯皮尔曼相关系数达到0.65,优于现有的感知度量标准。在包括翻唱歌曲识别和音乐流派分类在内的具有挑战性的MIR任务中,面对多种感知对抗攻击,我们的方法在鲁棒准确率上平均提高了9.15%。这项工作开创了架构集成的心理声学条件化方法,产生了与人类感知显著更对齐且对音乐对抗攻击具有鲁棒性的表示。

关键词

引用

@article{arxiv.2509.04985,
  title  = {Training a Perceptual Model for Evaluating Auditory Similarity in Music Adversarial Attack},
  author = {Yuxuan Liu and Rui Sang and Peihong Zhang and Zhixin Li and Shengchen Li},
  journal= {arXiv preprint arXiv:2509.04985},
  year   = {2025}
}