视频与文本的跨模态与层次化建模
计算机视觉与模式识别
2018-10-18 v1
摘要
视觉数据和文本数据由多粒度信息组成。一个视频可以描述一个复杂场景,该场景由多个片段或镜头组成,其中每个描绘一个语义连贯的事件或动作。类似地,一个段落可能包含具有不同主题的句子,它们共同传达一个连贯的信息或故事。在本文中,我们研究此类具有跨多种模态对应关系的层次化序列数据的建模技术。具体而言,我们引入层次化序列嵌入(HSE),一种将不同模态的序列数据嵌入到层次化语义空间中的通用模型,具有显式或隐式的对应关系信息。我们在大规模视频和段落检索数据集上进行实证研究,并证明了所提方法的优越性能。此外,我们检验了所学嵌入应用于下游任务时的有效性。我们展示了其在零样本动作识别和视频字幕生成中的效用。
引用
@article{arxiv.1810.07212,
title = {Cross-Modal and Hierarchical Modeling of Video and Text},
author = {Bowen Zhang and Hexiang Hu and Fei Sha},
journal= {arXiv preprint arXiv:1810.07212},
year = {2018}
}
备注
Accepted by ECCV 2018