中文

低秩 HOCA:面向视频字幕生成的高效高阶跨模态注意力

机器学习 2019-11-04 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

本文解决视频字幕生成这一旨在为视频数据生成描述的重要任务。近来,基于注意力的编码器-解码器结构已广泛用于视频字幕生成。在现有文献中,注意力权重常由单一模态的信息构建,而忽略了多模态之间的关联关係。受此启发,我们提出了一种具有高阶跨模态注意力(HOCA)的视频字幕生成模型,其注意力权重基于高阶相关张量计算,以充分捕获不同模态的帧级跨模态交互。此外,我们新颖地引入了低秩 HOCA,采用张量分解来降低 HOCA 极大的空间需求,从而在真实应用中实现实用且高效的部署。在两个基准数据集 MSVD 和 MSR-VTT 上的实验结果表明,低秩 HOCA 确立了新的最先进水平。

关键词

引用

@article{arxiv.1911.00212,
  title  = {Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning},
  author = {Tao Jin and Siyu Huang and Yingming Li and Zhongfei Zhang},
  journal= {arXiv preprint arXiv:1911.00212},
  year   = {2019}
}

备注

Accepted as a long paper at EMNLP 2019