中文

帝国理工学院 VATEX 视频描述任务提交报告

计算与语言 2019-10-17 v1 神经与进化计算

摘要

本文描述了帝国理工学院团队提交给 2019 年 VATEX 视频描述挑战赛的方案,我们首先探索了两种序列到序列模型,即一个循环(GRU)模型和一个 Transformer 模型,它们从 I3D 动作特征生成描述。随后,我们研究了丢弃编码器和注意力机制,转而基于两种不同的向量表示来调节 GRU 解码器的效果:(i) 一个最大池化的动作特征向量,以及 (ii) 一个多标签分类器的输出,该分类器被训练用于从动作特征中预测视觉实体。我们的基线模型取得了与官方基线相当的分数。基于实体预测的调节表现显著优于基于最大池化特征向量的调节,并且仅略逊于基于 GRU 的序列到序列基线。

关键词

引用

@article{arxiv.1910.07482,
  title  = {Imperial College London Submission to VATEX Video Captioning Task},
  author = {Ozan Caglayan and Zixiu Wu and Pranava Madhyastha and Josiah Wang and Lucia Specia},
  journal= {arXiv preprint arXiv:1910.07482},
  year   = {2019}
}