基于平均续传对数概率评估与奖励LALMs以实现富有表现力的角色扮演TTS
声音
2026-05-29 v2
摘要
近期大型音频语言模型(LALM)的进展将文本到语音(TTS)扩展到交互式角色扮演场景,这类场景对语音的表达性和对角色扮演指令的严格遵循性提出了挑战。然而,现有模型在维持跨多轮对话的角色档案和场景描述的风格一致性方面存在困难。一个关键瓶颈是缺乏量化语言表达风格的客观指标。为弥合这一差距,我们提出平均续传对数概率(Mean Continuation Log-Probability, MCLP)作为评估指标和奖励信号,其在LALM基于角色扮演TTS(RP-TTS)任务中得到验证。MCLP利用预训练LALM的上下文学习能力,衡量基于包含转录文本、生成语音和重复转录的上下文历史条件下,真实语音标记的概率,作为风格连续性的代理指标。此外,我们采用MCLP作为强化学习奖励来增强生成语音与角色扮演指令之间的风格对齐。为支持此任务,我们构建了一个包含丰富场景和角色注释的大型RP-TTS数据集。实验表明,MCLP与人类对风格一致性的判断高度一致,并可作为改进RP-TTS效果的有效奖励,两者在客观指标和主观评估方面均取得一致提升。我们的代码已公开:https://github.com/y-ren16/MCLP。
引用
@article{arxiv.2601.22661,
title = {Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability},
author = {Yong Ren and Jingbei Li and Haiyang Sun and Yujie Chen and Cheng Yi and Yechang Huang and Hao Gu and Ye Bai and Xuerui Yang},
journal= {arXiv preprint arXiv:2601.22661},
year = {2026}
}
备注
Accepted by ICML 2026