中文

ADIFF:使用自然语言解释音频差异

声音 2025-02-10 v1 人工智能 音频与语音处理

摘要

理解和解释音频录音之间的差异对于音频取证、质量评估和音频生成等领域至关重要。这涉及识别和描述音频事件、声学场景、信号特征及其对听众的情感影响。本文作为首项全面研究音频差异解释任务的工作,随后为该任务提出了基准和基线。首先,我们提出了两个源自 AudioCaps 和 Clotho 音频描述数据集的音频差异解释新数据集。使用大型语言模型(LLMs),我们生成了三个级别的差异解释:(1)音频事件和对象的简明描述,(2)关于音频事件、声学场景和信号属性的简短句子,以及(3)包含语义和听众情绪的综合解释。对于基线,我们使用前缀微调,其中来自两个音频文件的音频嵌入被用于提示一个冻结的语言模型。我们的实证分析和消融研究表明,朴素的基线难以区分感知上相似的声音并生成详细的第三级解释。为了解决这些局限性,我们提出了 ADIFF,它引入了交叉投影模块、位置描述和三步训练过程,以增强模型产生详细解释的能力。我们使用客观指标和人工评估来评估我们的模型,并表明我们的模型增强相较于朴素基线和最先进的音频语言模型(ALM)Qwen Audio 带来了显著的性能提升。最后,我们进行了多项消融研究,以探讨交叉投影、语言模型参数、位置描述、第三阶段微调的影响,并展示了我们的发现。我们的基准、发现和强大的基线为音频差异的细致且类人解释铺平了道路。

关键词

引用

@article{arxiv.2502.04476,
  title  = {ADIFF: Explaining audio difference using natural language},
  author = {Soham Deshmukh and Shuo Han and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2502.04476},
  year   = {2025}
}

备注

Accepted at ICLR 2025. Dataset and checkpoints are available at: https://github.com/soham97/ADIFF