中文

语音与唇部的动态时间对齐

计算机视觉与模式识别 2018-08-21 v1

摘要

电影中的许多语音片段在后期制作时会在录音室重新录制,以补偿外景录制时较差的音质。将新录制的语音与原始唇部运动手动对齐是一项繁琐的任务。我们提出一种音频到视频的对齐方法,用于自动化语音到唇部的对齐,通过拉伸和压缩音频信号来匹配唇部运动。该对齐基于深度音视频特征,将唇部视频和语音信号映射到共享表示。利用该共享表示,我们计算每个短语音段与每视频帧之间的唇形同步误差,进而确定整个视频片段中每个短声音段的最优对应帧。我们从定量(使用受人类感知启发的度量)和定性两方面展示了成功的对齐。我们的音频到视频方法的最大优势在于原始声音不清晰、且恒定偏移无法给出完美对齐的情况。在这些情况下,最先进的方法将会失效。

关键词

引用

@article{arxiv.1808.06250,
  title  = {Dynamic Temporal Alignment of Speech to Lips},
  author = {Tavi Halperin and Ariel Ephrat and Shmuel Peleg},
  journal= {arXiv preprint arXiv:1808.06250},
  year   = {2018}
}