RLAIF-SPA:用于语义-韵律对齐的结构化 AI 反馈
计算与语言
2026-04-08 v2 人工智能
摘要
最近的语音合成(TTS)技术在中性说话风格方面已接近人类水平。然而,大多数现有方法要么依赖昂贵的情感标注,要么优化旁cient objectives,未能充分捕捉感知情感质量。结果生成的语音虽在语义上准确,却往往缺乏表达性和情感丰富性。为此,我们提出 RLAIF-SPA,一种新型框架,将强化学习从 AI 反馈(RLAIF)集成到直接优化情感表达性与可理解性的场景中,而无需人工监督。具体而言,RLAIF-SPA 集成自动语音识别(ASR)提供语义准确性反馈,同时利用结构化奖励建模评估韵律-情感一致性。RLAIF-SPA 在四个结构化评估维度上实现对表达语音生成的更精确和细致控制:结构、情感、速度与语调。在 Libri-Speech、MELD 和普通话 ESD 数据集上的大量实验表明,该方法在干净朗读语音、对话式对话和情感语音方面均取得一致提升。在 Libri-Speech 上,RLAIF-SPA 在 Chat-TTS 上 consistently 超越,实现了 26.1% 的词错误率降低,9.1% 的 SIM-O 提升,以及 10% 以上的主观评价提升。
引用
@article{arxiv.2510.14628,
title = {RLAIF-SPA: Structured AI Feedback for Semantic-Prosodic Alignment in Speech Synthesis},
author = {Qing Yang and Zhenghao Liu and Yangfan Du and Pengcheng Huang and Tong Xiao},
journal= {arXiv preprint arXiv:2510.14628},
year = {2026}
}