中文

你听我所说吗?量化指令-感知差距在指令引导的表达文本转语音系统中的不匹配

音频与语音处理 2026-04-28 v6

摘要

指令引导文本转语音(ITTS)通过自然语言提示为用户提供语音生成的更直观界面。然而,用户风格指令与听众感知之间的对齐仍基本未探索。本工作首先对 ITTS 的可控性进行感知分析,涵盖两个表达维度(程度副词和分级情感强度),并收集关于说话人年龄和词级强调属性的人类评级。为全面揭示指令-感知差距,我们提供了一个大规模人类评估数据收集,命名为 Expressive VOice Control(E-VOC)语料库。进一步地,我们揭示了:(1)gpt-4o-mini-tts 是最可靠的 ITTS 模型,在声学维度上指令与生成语音之间的对齐度极佳。(2)5 个分析中的 ITTS 系统即使在要求使用儿童或老年说话人的指令下,也倾向于生成成人语音。(3)细粒度控制仍是一个主要挑战,表明大多数 ITTS 系统在解释稍有不同属性指令方面仍有很大的提升空间。

关键词

引用

@article{arxiv.2509.13989,
  title  = {Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems},
  author = {Yi-Cheng Lin and Huang-Cheng Chou and Tzu-Chieh Wei and Kuan-Yu Chen and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2509.13989},
  year   = {2026}
}

备注

Accepted to ICASSP 2026