视频预训练 Transformer:一种多模态预训练专家混合模型
计算机视觉与模式识别
2023-04-21 v1 人工智能
机器学习
摘要
我们提出视频预训练 Transformer(VPT)。VPT 使用先前工作中的四个 SOTA 编码器模型将视频转换为紧凑嵌入序列。我们的主干网络基于参考的 Flan-T5-11B 架构,学习视频的通用表示,该表示是各编码器模型的非线性加和。它通过自回归因果语言建模损失、预测 YouTube 视频中所说词语来进行学习。最后,我们在标准下游基准上通过为每个任务训练全连接预测头进行评估。据我们所知,这是首次在“嵌入 -> 主干 -> 预测头”设计模式中使用多个冻结的 SOTA 模型作为编码器——其他所有方法均训练了自身的联合编码器模型。此外,我们通过添加显式的场景图信息,比当前 SOTA 模型 Merlot Reserve 包含了更多模态。基于这两点,我们相信其可结合全球最佳开源模型以实现 SOTA 性能。初步实验表明模型正在恰当学习,但尚需更多实验与计算资源(已在推进中)以实现我们更宏大的目标。与此同时,我们在 YT-20M 数据集基础上进行复现,并为其语料库新增 25,000 个人工甄选的 YouTube 视频。所有代码与模型检查点均基于标准 MIT 许可开源。
引用
@article{arxiv.2304.10505,
title = {Video Pre-trained Transformer: A Multimodal Mixture of Pre-trained Experts},
author = {Kastan Day and Daniel Christl and Rohan Salvi and Pranav Sriram},
journal= {arXiv preprint arXiv:2304.10505},
year = {2023}
}