结合 ASR 与视觉特征生成教学视频字幕的案例研究
计算与语言
2019-10-08 v1
摘要
教学视频在视频分享平台上流量很高,已有工作表明提供带时间戳的子任务标注(如“在锅中热油”)可改善用户体验。然而,当前仅基于视觉特征的自动标注方法性能仅略优于常数预测。借鉴已有工作,我们展示通过将自动语音识别(ASR)词元作为输入可显著提升性能。此外,联合建模 ASR 词元与视觉特征相比在任一单模态上单独训练可获得更高性能。我们发现未言明的背景信息更易由视觉特征解释,而细粒度区分(如“加油”与“加橄榄油”)更易通过 ASR 词元消歧。
引用
@article{arxiv.1910.02930,
title = {A Case Study on Combining ASR and Visual Features for Generating Instructional Video Captions},
author = {Jack Hessel and Bo Pang and Zhenhai Zhu and Radu Soricut},
journal= {arXiv preprint arXiv:1910.02930},
year = {2019}
}