UmbraTTS:通过流匹配将文本到语音适配到环境上下文
声音
2025-07-14 v2 机器学习
音频与语音处理
摘要
近期语音合成(TTS)的进展实现了高度自然的语音合成,然而将语音与复杂背景环境集成仍然具有挑战性。我们提出了 UmbraTTS,一个基于流匹配的 TTS 模型,联合生成语音和环境音频,以文本和声学上下文为条件。我们的模型允许对背景音量进行细粒度控制,并产生多样、连贯且上下文感知的音频场景。一个关键挑战是缺乏语音和背景音频在自然语境中对齐的数据。为克服配对训练数据的匮乏,我们提出了一种自监督框架,从无标注录音中提取语音、背景音频和转录文本。广泛的评估表明,UmbraTTS 显著优于现有基线,生成了自然、高质量且具有环境意识的音频。
引用
@article{arxiv.2506.09874,
title = {UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching},
author = {Neta Glazer and Aviv Navon and Yael Segal and Aviv Shamsian and Hilit Segev and Asaf Buchnick and Menachem Pirchi and Gil Hetz and Joseph Keshet},
journal= {arXiv preprint arXiv:2506.09874},
year = {2025}
}
备注
ICML Workshop on Machine Learning for Audio 2025