一切同时——用于视频检索的多模态融合Transformer
计算机视觉与模式识别
2022-08-19 v2 计算与语言
声音
音频与语音处理
摘要
近年来,从视频数据中进行多模态学习日益受到关注,因为它允许在没有人工标注的情况下训练语义上有意义的嵌入,从而实现诸如零样本检索和分类等任务。在这项工作中,我们提出了一种多模态、模态无关的融合Transformer方法,该方法学习在多种模态(如视频、音频和文本)之间交换信息,并将它们整合到一个联合的多模态表示中,以获得聚合多模态时序信息的嵌入。我们提议使用一种组合损失函数对系统进行训练,该损失函数同时作用于所有模态、单一模态以及模态对,并明确省略任何附加组件,如位置编码或模态编码。在测试时,所得模型可以处理并融合任意数量的输入模态。此外,Transformer的隐式特性允许处理不同长度的输入。为评估所提出的方法,我们在大规模HowTo100M数据集上训练模型,并在四个具有挑战性的基准数据集上评估所得的嵌入空间,在零样本视频检索和零样本视频动作定位任务中均取得了最先进的结果。
引用
@article{arxiv.2112.04446,
title = {Everything at Once -- Multi-modal Fusion Transformer for Video Retrieval},
author = {Nina Shvetsova and Brian Chen and Andrew Rouditchenko and Samuel Thomas and Brian Kingsbury and Rogerio Feris and David Harwath and James Glass and Hilde Kuehne},
journal= {arXiv preprint arXiv:2112.04446},
year = {2022}
}
备注
CVPR2022. The final published version of the proceedings will be available on IEEE Xplore