半侵入式音频评估:将非侵入式评估转化为多模态文本预测任务
音频与语音处理
2025-01-23 v2 声音
摘要
人类感知具有专注于混合信号中特定事件的独特能力——这对现有的非侵入式评估方法是一项极具挑战性的任务。在本工作中,我们引入了半侵入式评估,通过将音频评估构建为带有音频-文本输入的文本预测任务来模拟人类注意力。为此,我们通过指令微调扩展了多模态 PENGI 模型,用于 MOS 和 SNR 估计。对于 MOS,我们的方法相较于重训练的 MOSRA 模型和预训练的 PAM 模型,分别取得了 0.06 和 0.20 的绝对 Pearson 相关系数提升。我们进一步提出了一种新颖的 SNR 估计器,能够专注于混合物中的特定音频源,其表现优于随机基线和固定提示对应方法。我们的研究结果表明,半侵入式评估能够有效捕捉类人的选择性聆听能力。样本可在 https://jozefcoldenhoff.github.io/semi-intrusive-assessment 获取。
引用
@article{arxiv.2409.14069,
title = {Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task},
author = {Jozef Coldenhoff and Milos Cernak},
journal= {arXiv preprint arXiv:2409.14069},
year = {2025}
}
备注
Accepted at ICASSP 2025