SNP-S3:面向多种视频-文本任务的共享网络预训练与显著语义增强
计算机视觉与模式识别
2024-02-01 v1 多媒体
摘要
我们提出了一个通过直接在原始数据上进行预训练来学习跨模态视频表示,以促进各种下游视频-文本任务的框架。我们的主要贡献在于预训练框架和代理任务。首先,基于两种主流像素级预训练架构的缺点(应用有限或效率较低),我们提出了共享网络预训练(SNP)。通过使用一个共享的 BERT 类型网络同时细化文本和跨模态特征,SNP 轻量且能支持各种下游应用。其次,基于人们在理解句子时总是关注几个“显著词”的直觉,我们提出了显著语义增强(S3)策略,该策略包含一种新颖的掩码和匹配代理任务,以提升预训练性能。在三个下游视频-文本任务和六个数据集上进行的实验表明,我们在像素级视频-文本预训练中建立了新的最优水平;我们还在预训练效率和微调性能之间取得了令人满意的平衡。代码库可在 https://github.com/alipay/Ant-Multi-Modal-Framework/tree/main/prj/snps3_vtp 获取。
引用
@article{arxiv.2401.17773,
title = {SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks},
author = {Xingning Dong and Qingpei Guo and Tian Gan and Qing Wang and Jianlong Wu and Xiangyuan Ren and Yuan Cheng and Wei Chu},
journal= {arXiv preprint arXiv:2401.17773},
year = {2024}
}
备注
Accepted by TCSVT (IEEE Transactions on Circuits and Systems for Video Technology)