FluentEditor:基于声学与韵律一致性考虑的文本驱动语音编辑
声音
2023-09-25 v2 人工智能
音频与语音处理
摘要
文本驱动语音编辑(TSE)技术旨在使用户通过修改输入文本转录而非音频本身来编辑输出音频。尽管基于神经网络的 TSE 技术已取得诸多进展,当前技术侧重于减小生成语音片段与编辑区域中参考目标的差异,忽略了其在上下文与原始话语中的局部与全局流畅度。为保持语音流畅度,我们提出一种流畅语音编辑模型,称为 \textit{FluentEditor},在 TSE 训练中引入流畅度感知训练准则。具体而言,\textit{声学一致性约束}旨在平滑编辑区域与其相邻声学片段之间同真实值一致的过渡,而 \textit{韵律一致性约束}力求确保编辑区域内的韵律属性与原始话语的整体风格保持一致。在 VCTK 上的主观与客观实验结果表明,我们的 \textit{FluentEditor} 在自然度与流畅度方面优于所有先进基线。音频样本与代码可在 \url{https://github.com/Ai-S2-Lab/FluentEditor} 获取。
引用
@article{arxiv.2309.11725,
title = {FluentEditor: Text-based Speech Editing by Considering Acoustic and Prosody Consistency},
author = {Rui Liu and Jiatian Xi and Ziyue Jiang and Haizhou Li},
journal= {arXiv preprint arXiv:2309.11725},
year = {2023}
}
备注
Submitted to ICASSP'2024