中文

零样文本合成中的语音印象控制

声音 2026-02-19 v3 计算与语言 机器学习 音频与语音处理

摘要

语音中的para-/non-linguistic信息对塑造听者的印象至关重要。虽然零样文本合成(TTS)已实现高水平说话人保真度,但对细微的para-/non-linguistic信息进行调制以控制感知到的语音特征,即印象,仍富有挑战性。因此,我们发展了一种在零样TTS中实现语音印象控制的方法,该方法利用低维向量表示各种语音印象对(例如dark-bright)的强度。客观和主观评估结果均证明了该方法在印象控制方面的有效性。进一步地,通过大型语言模型生成该向量,可实现从自然语言描述的目标印象进行目标印象生成,从而消除对手动优化的需求。音频示例可在我们的演示页面(https://ntt-hilab-gensp.github.io/is2025voiceimpression/)上获取。

关键词

引用

@article{arxiv.2506.05688,
  title  = {Voice Impression Control in Zero-Shot TTS},
  author = {Kenichi Fujita and Shota Horiguchi and Yusuke Ijima},
  journal= {arXiv preprint arXiv:2506.05688},
  year   = {2026}
}

备注

5 pages,5 figures, Accepted to INTERSPEECH 2025