TVTSv2:大规模学习开箱即用的时空视觉表征
计算机视觉与模式识别
2023-05-24 v1 人工智能
摘要
基础模型的最终目标是实现任务无关,即支持无需任务特定微调的开箱即用。尽管在自然语言处理与图像表征学习方面已取得突破,由于时空信号不确定性的增加,视频模型仍难以达成该目标。为简化训练,现有工作利用图像基础模型的先验知识并为其配备高效时间模块。尽管微调性能令人满意,我们经实证发现它们不足以开箱即用,在零样本/线性协议下相比基线对应模型性能甚至退化。本工作中,我们从语言监督失真视角分析了导致退化的因素。我们认为,如先前工作那样端到端微调文本编码器是次优的,因其可能在风格上过拟合,从而丧失捕捉各类语域语义的原始泛化能力。过拟合的文本编码器反过来提供有害监督信号, degrading 视频表征。为解决此问题,我们提出一种无退化预训练策略,通过冻结浅层保留文本编码器泛化能力,同时在可微调深层中捕获任务相关语义。在训练目标上,我们采用 TVTS 中的转录排序任务并结合掩码技术以实现可扩展训练。由此,我们产生了一系列称为 TVTSv2 的模型,参数规模最高达十亿。我们以冻结主干在各类视频基准上取得新最优结果,超越近期的 ImageBind、InternVideo 等。代码见 https://github.com/TencentARC/TVTS。
引用
@article{arxiv.2305.14173,
title = {TVTSv2: Learning Out-of-the-box Spatiotemporal Visual Representations at Scale},
author = {Ziyun Zeng and Yixiao Ge and Zhan Tong and Xihui Liu and Shu-Tao Xia and Ying Shan},
journal= {arXiv preprint arXiv:2305.14173},
year = {2023}
}
备注
Technical Report