MILES:用于视频文本检索的注入语言语义的视觉 BERT 预训练
计算机视觉与模式识别
2022-04-27 v1
摘要
视频文本检索的主流预训练工作主要采用“双编码器”架构以实现高效检索,其中使用两个独立的编码器来对比全局视频和文本表示,但忽略了详细的局部语义。近期图像 BERT 预训练在掩码视觉建模方面的成功促进了局部视觉上下文的学习,这为解决上述局限性提供了一种可能的解决方案。在本工作中,我们首次在具有“双编码器”架构的视频文本预训练中研究掩码视觉建模。我们通过采用额外的快照视频编码器作为不断演进的“分词器”来为掩码视频块预测产生重建目标,从而执行注入语言语义的掩码视觉建模(MILES)。给定损坏的视频,视频编码器被训练为通过沿空间和时间维度对可见区域进行推理来恢复掩码块的对齐文本特征,这增强了局部视觉特征的判别性和细粒度的跨模态对齐。我们的方法在四个数据集上的零样本和微调评估协议下均优于文本到视频检索的最先进方法。我们的方法在零样本动作识别上也显著超越了基线模型,该任务可被视为视频到文本检索。
引用
@article{arxiv.2204.12408,
title = {MILES: Visual BERT Pre-training with Injected Language Semantics for Video-text Retrieval},
author = {Yuying Ge and Yixiao Ge and Xihui Liu and Alex Jinpeng Wang and Jianping Wu and Ying Shan and Xiaohu Qie and Ping Luo},
journal= {arXiv preprint arXiv:2204.12408},
year = {2022}
}