AttentionStitch:注意力机制如何解决语音编辑问题
音频与语音处理
2024-03-11 v1 计算与语言
机器学习
多媒体
摘要
从文本生成自然且高质量的语音是自然语言处理领域的一个挑战性问题。除了语音生成,语音编辑也是一项关键任务,它要求将编辑后的语音无缝且不引人注意地整合到合成语音中。我们提出了一种新颖的语音编辑方法,该方法利用预训练的文本到语音 (TTS) 模型(如 FastSpeech 2),并在其基础上引入双重注意力块网络,以自动将合成的 mel 频谱图与编辑文本的 mel 频谱图融合。我们将该模型称为 AttentionStitch,因为它利用注意力机制将音频样本拼接在一起。我们在单说话人和多说话人数据集(即 LJSpeech 和 VCTK)上将所提出的 AttentionStitch 模型与最先进的基线模型进行了评估。通过一项包含 15 名人类参与者的客观和主观评估测试,我们展示了其卓越的性能。AttentionStitch 能够生成高质量的语音,即使是训练期间未见过的词语也能处理,同时全自动运行,无需人工干预。此外,AttentionStitch 在训练和推理期间都很快速,并且能够生成听起来像人类的编辑语音。
引用
@article{arxiv.2403.04804,
title = {AttentionStitch: How Attention Solves the Speech Editing Problem},
author = {Antonios Alexos and Pierre Baldi},
journal= {arXiv preprint arXiv:2403.04804},
year = {2024}
}
备注
Accepted in Machine Learning for Audio workship in NeurIPS 2023