面向合成语音的听觉感知引导的MOS预测器
声音
2025-04-30 v1 人工智能
音频与语音处理
摘要
自动语音质量评估旨在通过计算模型对语音的主观人类感知进行量化,从而减少对耗时的手动评估需求。虽然基于深度学习的模型在预测语音平均意见分数(MOS)方面取得了进展,但忽视了基本听觉感知机制,导致其与人类判断的一致性受限。为此,我们提出一种听觉感知引导的MOS预测模型(APG-MOS),通过生物听觉机制建模与语义分析的协同集成,提升与人类判断的一致性。具体而言,我们首先设计了感知模块,基于生物听觉机制,模拟毛细血管功能,将声学信号编码为生物学一致的电化学表示。其次,我们提出一种基于残差向量量化(RVQ)的语义失真建模方法,用于量化语音质量在语义层面的退化。最后,我们设计了残差跨注意力架构,并辅以渐进式学习策略,实现对编码后的电化学信号和语义表示的多模态融合。实验表明,APG-MOS在两个主要基准数据集上取得优异性能。我们将在论文发表后在公开仓库中提供代码和模型权重。
引用
@article{arxiv.2504.20447,
title = {APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech},
author = {Zhicheng Lian and Lizhi Wang and Hua Huang},
journal= {arXiv preprint arXiv:2504.20447},
year = {2025}
}