PAM:面向音频质量评估的音频语言模型提示
音频与语音处理
2024-02-02 v1 声音
摘要
虽然音频质量是各种音频处理任务(包括生成式建模)的关键性能指标,但其客观测量仍然是一个挑战。音频语言模型(ALMs)在音频-文本对上进行预训练,这些文本对可能包含有关音频质量、伪影存在或噪声的信息。给定音频输入和与质量相关的文本提示,可以使用 ALM 计算两者之间的相似度得分。在此,我们利用这一能力并引入了 PAM,一种用于评估不同音频处理任务音频质量的无参考度量指标。与其他“无参考”指标不同,PAM 不需要在参考数据集上计算嵌入,也不需要在昂贵的一组人类听觉评分上训练特定任务模型。我们在四个任务上广泛评估了 PAM 相对于既有指标和人类听觉评分的可靠性:文本到音频(TTA)、文本到音乐生成(TTM)、文本到语音(TTS)和深度噪声抑制(DNS)。我们在受控失真、自然环境和提示选择下进行了多次消融研究。我们的评估表明,PAM 与现有指标和人类听觉评分具有良好的相关性。这些结果证明了 ALM 在计算通用音频质量指标方面的潜力。
引用
@article{arxiv.2402.00282,
title = {PAM: Prompting Audio-Language Models for Audio Quality Assessment},
author = {Soham Deshmukh and Dareen Alharthi and Benjamin Elizalde and Hannes Gamper and Mahmoud Al Ismail and Rita Singh and Bhiksha Raj and Huaming Wang},
journal= {arXiv preprint arXiv:2402.00282},
year = {2024}
}