零样文本合成中的语音印象控制
声音
2026-02-19 v3 计算与语言
机器学习
音频与语音处理
摘要
语音中的para-/non-linguistic信息对塑造听者的印象至关重要。虽然零样文本合成(TTS)已实现高水平说话人保真度,但对细微的para-/non-linguistic信息进行调制以控制感知到的语音特征,即印象,仍富有挑战性。因此,我们发展了一种在零样TTS中实现语音印象控制的方法,该方法利用低维向量表示各种语音印象对(例如dark-bright)的强度。客观和主观评估结果均证明了该方法在印象控制方面的有效性。进一步地,通过大型语言模型生成该向量,可实现从自然语言描述的目标印象进行目标印象生成,从而消除对手动优化的需求。音频示例可在我们的演示页面(https://ntt-hilab-gensp.github.io/is2025voiceimpression/)上获取。
引用
@article{arxiv.2506.05688,
title = {Voice Impression Control in Zero-Shot TTS},
author = {Kenichi Fujita and Shota Horiguchi and Yusuke Ijima},
journal= {arXiv preprint arXiv:2506.05688},
year = {2026}
}
备注
5 pages,5 figures, Accepted to INTERSPEECH 2025