中文

表征使用预训练模型提取的特征对视频描述序列到序列模型质量的影响

计算机视觉与模式识别 2020-10-13 v1

摘要

视频描述任务,即自动生成描述视频中一系列动作的语句,近年来引起了越来越多的关注。视频数据复杂且高维的表示使得典型的编码器-解码器架构难以识别相关特征并将其编码为合适的形式。视频数据包含可通过图像、场景、动作和音频特征混合识别的不同模态。本文刻画了影响视频描述的不同特征,并探究了这些特征之间的相互作用及其如何影响视频表示的最终质量。基于利用有限视频信息范围的现有编码器-解码器模型,我们的对比表明多模态视频特征的引入可显著改善生成语句的质量。该工作对于使用序列到序列模型生成视频描述的科研人员和从业者具有特殊意义。

关键词

引用

@article{arxiv.1911.09989,
  title  = {Characterizing the impact of using features extracted from pre-trained models on the quality of video captioning sequence-to-sequence models},
  author = {Menatallh Hammad and May Hammad and Mohamed Elshenawy},
  journal= {arXiv preprint arXiv:1911.09989},
  year   = {2020}
}

备注

Submitted to conference ICPRAI2020