中文

视觉字幕特征增强的视频大纲生成

计算机视觉与模式识别 2022-09-02 v2 人工智能 计算与语言

摘要

随着视频数量的急剧增加,迫切需要能够帮助用户快速导航到感兴趣视频片段的技术。然而,当前视频理解的工作主要集中在视频内容摘要上,而对探索视频结构的努力很少。受文本大纲生成的启发,我们引入了一个新颖的视频理解任务,即视频大纲生成(VOG)。该任务定义为包含两个子任务:(1)首先根据内容结构对视频进行分割,然后(2)为每个片段生成标题。为了学习和评估VOG,我们标注了一个10k+的数据集,称为DuVOG。具体来说,我们使用OCR工具识别视频的字幕。然后要求标注者将字幕划分为章节并为每个章节命名。在视频中,高亮文本往往是标题,因为它更可能吸引注意力。因此,我们提出了一种视觉字幕特征增强的视频大纲生成模型(VSENet),该模型将文本字幕及其视觉字体大小和位置作为输入。我们将VOG任务视为一个序列标注问题,提取标题所在的跨度,然后重写它们以形成最终的大纲。此外,基于视频大纲和文本大纲之间的相似性,我们使用大量带有章节标题的文章来预训练我们的模型。在DuVOG上的实验表明,我们的模型大大优于其他基线方法,在视频分割级别上达到了77.1的F1分数,在标题生成级别上达到了85.0的ROUGE-L_F0.5。

关键词

引用

@article{arxiv.2208.11307,
  title  = {Visual Subtitle Feature Enhanced Video Outline Generation},
  author = {Qi Lv and Ziqiang Cao and Wenrui Xie and Derui Wang and Jingwen Wang and Zhiwei Hu and Tangkun Zhang and Ba Yuan and Yuanhang Li and Min Cao and Wenjie Li and Sujian Li and Guohong Fu},
  journal= {arXiv preprint arXiv:2208.11307},
  year   = {2022}
}