重振区域特征以推动检索型视频-语言预训练的普及化
计算机视觉与模式识别
2023-02-08 v3
摘要
近期视频-语言预训练(VLP)的主流方法以端到端方式从原始像素学习可迁移表征,从而在下游视频-语言检索上取得先进性能。尽管结果令人印象深刻,VLP 研究因需要海量数据与漫长训练时间而变得极其昂贵,阻碍了进一步探索。本工作中,我们重振稀疏采样视频片段的区域特征,显著减少空间与时间视觉冗余,在推动 VLP 研究普及化的同时取得最先进结果。具体而言,为充分挖掘区域特征潜力,我们引入一种新颖的双向区域-词对齐正则化,恰当优化区域与句中特定词之间的细粒度关系,消除预提取区域特征与文本间的领域/模态脱节。在四个数据集上的下游视频-语言检索任务广泛结果证明了我们的方法在效果与效率上的优越性,例如,与迄今最高效的 VLP 方法相比,我们的方法以少 80% 的数据和少 85% 的预训练时间取得竞争结果。代码将发布于 \url{https://github.com/showlab/DemoVLP}。
引用
@article{arxiv.2203.07720,
title = {Revitalize Region Feature for Democratizing Video-Language Pre-training of Retrieval},
author = {Guanyu Cai and Yixiao Ge and Binjie Zhang and Alex Jinpeng Wang and Rui Yan and Xudong Lin and Ying Shan and Lianghua He and Xiaohu Qie and Jianping Wu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2203.07720},
year = {2023}
}