RoME:用于文本到视频检索的角色感知混合专家 Transformer
计算机视觉与模式识别
2022-06-28 v1 信息检索
机器学习
摘要
随着社交渠道的流行,每日有海量视频上传,因此用用户文本查询检索最相关视频内容变得更为关键。多数方法仅考虑全局视觉与文本特征间的一个联合嵌入空间,而未考虑各模态的局部结构。另一些方法分别考虑由全局与局部特征构成的多个嵌入空间,却忽略了丰富的模态间关联。我们提出一种新颖的混合专家 Transformer RoME,将文本与视频解耦为三个层次:空间上下文、时间上下文与对象上下文的角色。我们利用基于 Transformer 的注意力机制,配合混合专家充分挖掘全局与局部层次的视觉与文本嵌入,以兼顾模态间与结构间的关联。结果表明,在相同的视觉骨干网络且未经预训练的条件下,我们的方法在 YouCook2 与 MSR-VTT 数据集上优于当前最优(SOTA)方法。最后,我们进行了广泛的消融实验以阐明我们的设计选择。
引用
@article{arxiv.2206.12845,
title = {RoME: Role-aware Mixture-of-Expert Transformer for Text-to-Video Retrieval},
author = {Burak Satar and Hongyuan Zhu and Hanwang Zhang and Joo Hwee Lim},
journal= {arXiv preprint arXiv:2206.12845},
year = {2022}
}
备注
Preprint, under review in TCSVT Journal