中文

P2VA:将人物描述转换为语音属性,以实现公平且可控的文本转语音

音频与语音处理 2025-09-22 v2 计算与语言

摘要

虽然人物驱动的大型语言模型(LLM)和基于提示的人工智能语音(TTS)系统已取得显著进展,但在用户尝试生成符合其理想人物描述的语音时,仍存在可用性差距。大多数用户缺乏专业知识,无法指定详细的语音属性,这往往导致TTS系统误解他们的期望。为此,我们引入Persona-to-Voice-Attribute(P2VA),这是第一个从人物描述自动生成语音的框架。我们的方法采用两种策略:P2VA-C用于结构化语音属性,P2VA-O用于更丰富的风格描述。我们的评估显示,P2VA-C将错误识别率(WER)降低5%,并使满意度评分(MOS)提高0.33分。据我们了解,P2VA是首个建立人物与语音合成连接的框架。此外,我们发现当前的LLM在转换过程中嵌入了社会偏见于语音属性中。我们的实验和发现进一步提供了构建人物-语音系统的挑战性见解。

关键词

引用

@article{arxiv.2505.17093,
  title  = {P2VA: Converting Persona Descriptions into Voice Attributes for Fair and Controllable Text-to-Speech},
  author = {Yejin Lee and Jaehoon Kang and Kyuhong Shim},
  journal= {arXiv preprint arXiv:2505.17093},
  year   = {2025}
}