中文

基于文本动态注意力与逐步学习的视频描述生成

计算机视觉与模式识别 2019-11-06 v1

摘要

用自然语言自动描述视频内容在 CV 与 NLP 领域已引起大量关注。多数现有方法一次预测一个词,并将上次生成的词作为下一时刻输入反馈,而其他已生成的词未被充分利用。此外,传统方法在每个轮次中使用所有训练样本优化模型而不考虑其学习状况,导致大量不必要训练且无法针对困难样本。为解决这些问题,我们提出一种名为 TDAM 的基于文本的动态注意力模型,其对所有已生成词施加动态注意力机制,旨在改善上下文语义信息并增强对整个句子的整体控制。此外,基于文本的动态注意力机制与视觉注意力机制相互关联以聚焦于重要词。它们在训练期间可相互受益。相应地,模型通过两步训练:“从零开始”和“查漏补缺”。前者用所有样本优化模型,后者仅对控制不佳的样本训练。在流行数据集 MSVD 和 MSR-VTT 上的实验结果表明,我们的非集成模型优于最先进的视频描述生成基准。

关键词

引用

@article{arxiv.1911.01857,
  title  = {Video Captioning with Text-based Dynamic Attention and Step-by-Step Learning},
  author = {Huanhou Xiao and Jinglun Shi},
  journal= {arXiv preprint arXiv:1911.01857},
  year   = {2019}
}

备注

The paper is under consideration at Pattern Recognition Letters