COOT:用于视频-文本表示学习的协作层次Transformer
计算机视觉与模式识别
2020-11-03 v1 人工智能
计算与语言
机器学习
摘要
许多现实世界的视频-文本任务涉及不同粒度的层次,如帧与词、片段与句子或视频与段落,各自具有不同语义。本文中,我们提出协作层次Transformer(COOT)以利用该层次信息并建模不同粒度层次与不同模态间的交互。该方法由三个主要组件构成:注意力感知特征聚合层,利用局部时间上下文(层内,如片段内);上下文Transformer学习低层与高层语义间交互(层间,如片段-视频、句子-段落);以及连接视频与文本的交叉模态循环一致性损失。所得方法在多个基准上优于最先进水平,同时参数量很少。所有代码开源于https://github.com/gingsi/coot-videotext。
引用
@article{arxiv.2011.00597,
title = {COOT: Cooperative Hierarchical Transformer for Video-Text Representation Learning},
author = {Simon Ging and Mohammadreza Zolfaghari and Hamed Pirsiavash and Thomas Brox},
journal= {arXiv preprint arXiv:2011.00597},
year = {2020}
}
备注
27 pages, 5 figures, 19 tables. To be published in the 34th conference on Neural Information Processing Systems (NeurIPS 2020). The first two authors contributed equally to this work