深度视觉强制对齐:学习将转录文本与说话人脸视频对齐
计算机视觉与模式识别
2023-03-16 v1 人工智能
声音
音频与语音处理
摘要
强制对齐(forced alignment)是指将给定转录文本与相应语音进行时间对齐的技术。然而,由于强制对齐技术是基于语音音频发展的,当输入语音音频受噪声污染或不可获取时,它们可能在对齐上失效。我们关注到语音还可从另一组件推断而来,即语音视频(即说话人脸视频)。由于在音频信号状况不佳时,基于音频的强制对齐的缺陷可利用视觉信息加以弥补,我们尝试开发一种新颖的基于视频的强制对齐方法。然而,与音频强制对齐不同,开发可靠的视觉强制对齐技术面临以下两个挑战:1)视觉语音识别(VSR)的性能远低于基于音频的自动语音识别(ASR);2)从文本到视频的转换不可靠,因此通常用于构建音频强制对齐的方法无法用于开发视觉强制对齐。为缓解这些挑战,本文提出一种适用于视觉强制对齐的新方法,即深度视觉强制对齐(DVFA)。所提出的 DVFA 可在不访问语音音频的情况下将输入转录文本(即句子)与说话人脸视频对齐。此外,通过将对齐任务与异常情形检测相结合,DVFA 可在执行对齐的同时检测输入转录文本与输入视频之间的不匹配。因此,即使文本中存在错误词,我们也能鲁棒地将文本与说话人脸视频对齐。通过大量实验,我们展示了所提出的 DVFA 不仅在对齐任务中有效,而且在解释 VSR 模型输出方面同样有效。
引用
@article{arxiv.2303.08670,
title = {Deep Visual Forced Alignment: Learning to Align Transcription with Talking Face Video},
author = {Minsu Kim and Chae Won Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2303.08670},
year = {2023}
}
备注
Accepted in AAAI2023