手语视频中的字幕时间对齐
计算机视觉与模式识别
2021-05-07 v1
摘要
本工作的目标是在手语视频中对异步字幕进行时间对齐。具体而言,我们关注手语翻译的电视广播数据,其包含(i)连续手语视频,以及(ii)对应音频内容的字幕。先前利用此类弱对齐数据的工作仅考虑关键词—手语对应关系,而我们的目标是定位连续手语中的完整字幕文本。我们提出了一种针对该任务定制的 Transformer 架构,并在覆盖超过 15K 条字幕、跨度 17.7 小时视频的人工标注对齐数据上训练。我们使用 BERT 字幕嵌入和为手语识别学习的 CNN 视频表示来编码两种信号,二者通过一系列注意力层交互。我们的模型输出帧级预测,即对每个视频帧,判断其是否属于所查询字幕。通过大量评估,我们展示了相比未利用字幕文本嵌入学习的现有对齐基线方法的显著改进。我们的自动对齐模型为通过提供连续同步的视频—文本数据来推进手语机器翻译开辟了可能。
引用
@article{arxiv.2105.02877,
title = {Aligning Subtitles in Sign Language Videos},
author = {Hannah Bull and Triantafyllos Afouras and Gül Varol and Samuel Albanie and Liliane Momeni and Andrew Zisserman},
journal= {arXiv preprint arXiv:2105.02877},
year = {2021}
}