生成式语音恢复的多指标偏好对齐
声音
2025-11-18 v2 人工智能
机器学习
音频与语音处理
摘要
近期的生成模型显著推进了语音恢复任务,但其训练目标常常与人类感知偏好不匹配,导致质量次优。虽然后训练对齐在其他生成领域如文本和图像生成中证明有效,但其在生成式语音恢复中的应用仍大体未被探索。本文调查了将偏好基于后训练应用于此任务的挑战,重点关注如何定义稳健的偏好信号并精选高质量数据以避免奖励攻击。为解决这些挑战,我们提出了一种多指标偏好对齐策略。我们构建了一个新的数据集 GenSR-Pref,包含 80K 条偏好对,其中每个被选样本都被一套覆盖感知质量、信号保真度、内容一致性和音色保持的互补指标一致偏好。这种原则方法确保了整体偏好信号。应用我们的数据集进行 Direct Preference Optimization(DPO),我们在三个不同生成范式:自回归模型(AR)、掩码生成模型(MGM)和流匹配模型(FM)在各种恢复基准测试中,观察到在客观和主观评估中的一致显著性能提升。消融研究确认了我们多指标策略优于单指标方法在缓解奖励攻击方面的优势。此外,我们展示了对齐模型可作为强大的“数据标注员”,生成高质量的伪标签,以用作数据稀缺场景如人声演唱恢复中传统判别模型监督信号。演示页面:https://gensr-pref.github.io
引用
@article{arxiv.2508.17229,
title = {Multi-Metric Preference Alignment for Generative Speech Restoration},
author = {Junan Zhang and Xueyao Zhang and Jing Yang and Yuancheng Wang and Fan Fan and Zhizheng Wu},
journal= {arXiv preprint arXiv:2508.17229},
year = {2025}
}
备注
Accepted by AAAI 2026. Demopage: https://gensr-pref.github.io