鲁棒生成音频质量评估:分离质量与虚假关联
音频与语音处理
2026-03-18 v1 人工智能
声音
信号处理
摘要
AI 生成内容(AIGC)的快速普及 necessitates robust metrics for perceptual quality assessment。然而,自动均值意见分数(MOS)预测模型常因数据稀缺而受限,容易学习虚假关联——例如数据集特定的声学特征——而非通用的质量特征。为此,我们利用域对抗训练(DAT)来分离真实的质量感知与这些 nuisance 因素。不同于以往依赖静态域先验的做法,我们系统性地研究了从显式元数据驱动标签到隐式数据驱动聚类的域定义策略。我们的发现表明,不存在“通用方案”;相反,最佳策略高度取决于具体评估的 MOS 方面。实验结果表明,我们的方面特定域策略有效缓解了声学偏见,显著提高了与人类评分的相关性,并在 unseen generative 场景中实现卓越的泛化。
引用
@article{arxiv.2603.16201,
title = {Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations},
author = {Kuan-Tang Huang and Chien-Chun Wang and Cheng-Yeh Yang and Hung-Shin Lee and Hsin-Min Wang and Berlin Chen},
journal= {arXiv preprint arXiv:2603.16201},
year = {2026}
}
备注
Accepted to IEEE ICME 2026