LibriTTS-VI: 面向语音印象控制的公开语料库与新方法
声音
2026-03-10 v3 音频与语音处理
摘要
数值语音印象(VI)控制(例如调整亮度)可实现文本转换语音(TTS)中的细粒度控制。然而,这面临两个挑战:缺乏公开语料库以及印象泄漏问题,即参考音频会偏向合成语音远离目标 VI。为解决第一个挑战,我们引入 LibriTTS-VI,这是第一个基于 LibriTTS-R 构建的公开 VI 语料库。为解决第二个问题,我们假设单一参考导致印象泄漏,是由于说话人身份与 VI 被 entangled。为缓解这一问题,我们提出 1) 采用来自同一说话人的两个句子进行说话人和 VI 条件解耦训练,以及 2) 一种无参考方法,通过目标 VI solely 控制印象。实验表明,我们最佳方法在可控性方面取得改进:11 维 VI 均方误差分别从 0.61 降至 0.41(客观评估),从 1.15 降至 0.92(主观评估)。与基于提示的 TTS 进行比较显示,我们的方法在数值控制精度和 VI 与文本语义之间的 entanglement 方面具有优势。
关键词
引用
@article{arxiv.2509.15626,
title = {LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control},
author = {Junki Ohmura and Yuki Ito and Emiru Tsunoo and Toshiyuki Sekiya and Toshiyuki Kumakura},
journal= {arXiv preprint arXiv:2509.15626},
year = {2026}
}
备注
Submitted to Interspeech 2026