使用 RLHF 将语音增强方法对齐到 mean-opinion quality 评分
音频与语音处理
2024-10-18 v1 声音
摘要
客观语音质量指标通常用于评估语音增强算法,但已证明它们作为学习目标时次优于人类主观评级。这种对齐不足常导致可见的失真和伪影,使语音增强效果不佳。为解决这些问题,我们提出了一种基于强化学习从人类反馈(RLHF)的框架,用于微调现有的语音增强方法,通过优化性能使用基于 MOS 的奖励模型。我们的结果表明,RLHF 微调模型在 Voicebank+DEMAND 数据集上针对客观和 MOS 基语音质量评估指标均表现最佳。通过消融研究,我们表明 policy gradient 损失和监督 MSE 损失对于在不同指标之间进行平衡优化至关重要。
引用
@article{arxiv.2410.13182,
title = {Using RLHF to align speech enhancement approaches to mean-opinion quality scores},
author = {Anurag Kumar and Andrew Perrault and Donald S. Williamson},
journal= {arXiv preprint arXiv:2410.13182},
year = {2024}
}
备注
Submitted to ICASSP 2025