中文

通过预训练将事件检测与字幕生成统一为序列生成任务

计算机视觉与模式识别 2023-07-24 v1

摘要

密集视频字幕生成旨在为未剪辑视频中的一系列事件生成相应的文本描述,这可划分为事件检测和事件字幕生成两个子任务。与以往分别处理这两个子任务的工作不同,近期的工作侧重于增强这两个子任务之间的任务间关联。然而,由于事件检测和字幕生成在特定任务解决方案上存在巨大差异,为它们设计任务间交互并非易事。此外,以往的事件检测方法通常忽略事件之间的时间依赖性,导致事件冗余或不一致问题。为了解决上述两个缺陷,本文将事件检测定义为序列生成任务,并提出一个统一的预训练与微调框架,以自然地增强事件检测与字幕生成之间的任务间关联。由于模型在预测每个事件时将先前事件作为上下文,事件之间的相互依赖性得到了充分利用,因此我们的模型能够在视频中检测出更加多样且一致的事件。在 ActivityNet 数据集上的实验表明,我们的模型优于 SOTA 方法,并且在额外的大规模视频-文本数据上进行预训练后可进一步提升性能。代码可在 \url{https://github.com/QiQAng/UEDVC} 获取。

关键词

引用

@article{arxiv.2207.08625,
  title  = {Unifying Event Detection and Captioning as Sequence Generation via Pre-Training},
  author = {Qi Zhang and Yuqing Song and Qin Jin},
  journal= {arXiv preprint arXiv:2207.08625},
  year   = {2023}
}