面向唇语转语音合成的音视频同步研究
声音
2023-03-02 v1 计算机视觉与模式识别
音频与语音处理
摘要
大多数唇语转语音(LTS)合成模型在数据集中的音视频对完全同步这一假设下训练和评估。在本工作中,我们表明常用的音视频数据集,如 GRID、TCD-TIMIT 和 Lip2Wav,可能存在数据异步问题。使用此类数据集训练唇语转语音可能进一步引发模型异步问题——即生成的语音与输入视频不同步。为解决这些异步问题,我们提出一种带自动同步机制(ASM)的同步唇语转语音(SLTS)模型,以纠正数据异步并惩罚模型异步。我们进一步展示了常用 LTS 评估指标在异步测试数据上的局限性,并引入一个音频对齐前端置于对时间对齐敏感的指标之前,以获得更好的评估。我们在常规与时间对齐指标上将我们的方法与最先进方法进行比较,以展示同步训练的益处。
引用
@article{arxiv.2303.00502,
title = {On the Audio-visual Synchronization for Lip-to-Speech Synthesis},
author = {Zhe Niu and Brian Mak},
journal= {arXiv preprint arXiv:2303.00502},
year = {2023}
}