M2-RAAP:一种推进基于适应的预训练以实现有效且高效零样本视频-文本检索的多模态配方
计算机视觉与模式识别
2024-02-01 v1
摘要
我们提出了一种推进基于适应的预训练以实现有效且高效零样本视频-文本检索的多模态配方,称为M2-RAAP。在像CLIP这样的流行图像-文本模型上,当前大多数基于适应的视频-文本预训练方法面临三个主要问题,即数据语料库噪声大、预训练耗时以及性能提升有限。为此,我们进行了一项全面的研究,涵盖视频-文本预训练的四个关键步骤。具体而言,我们研究了1)数据过滤与精炼,2)视频输入类型选择,3)时序建模,以及4)视频特征增强。然后,我们将这项实证研究总结为M2-RAAP配方,我们的技术贡献在于1)数据过滤和文本重写流水线,产生了100万高质量的双语视频-文本对,2)用关键帧替换视频输入以加速预训练,以及3)辅助标题引导策略以增强视频特征。我们通过在两个不同语言的精炼视频-文本数据集上适应三个图像-文本基础模型进行了大量实验,验证了M2-RAAP用于基于适应的预训练的鲁棒性和可复现性。结果表明,M2-RAAP在显著减少数据量(-90%)和时间消耗(-95%)的情况下,实现了优越的性能,在四个英文零样本检索数据集和两个中文数据集上建立了新的SOTA。我们正在准备我们的精炼双语数据标注和代码库,它们将在https://github.com/alipay/Ant-Multi-Modal-Framework/tree/main/prj/M2_RAAP上可用。
引用
@article{arxiv.2401.17797,
title = {M2-RAAP: A Multi-Modal Recipe for Advancing Adaptation-based Pre-training towards Effective and Efficient Zero-shot Video-text Retrieval},
author = {Xingning Dong and Zipeng Feng and Chunluan Zhou and Xuzheng Yu and Ming Yang and Qingpei Guo},
journal= {arXiv preprint arXiv:2401.17797},
year = {2024}
}