PolyViT:在图像、视频和音频上协同训练 Vision Transformers
计算机视觉与模式识别
2021-11-29 v1 机器学习
摘要
我们能否训练一个能够处理多种模态和数据集,同时共享几乎所有可学习参数的单一 Transformer 模型?我们提出了 PolyViT,一个在图像、音频和视频上训练的模型,回答了这个问题。通过在单一模态上协同训练不同任务,我们能够提高每个单独任务的准确率,并在 5 个标准视频和音频分类数据集上取得了 SOTA 结果。在多种模态和任务上协同训练 PolyViT 产生了一个参数效率更高、且能学习跨多个领域泛化表示的模型。此外,我们表明协同训练简单且易于实现,因为我们不需要为每种数据集组合调整超参数,而可以直接采用标准单任务训练中的超参数。
引用
@article{arxiv.2111.12993,
title = {PolyViT: Co-training Vision Transformers on Images, Videos and Audio},
author = {Valerii Likhosherstov and Anurag Arnab and Krzysztof Choromanski and Mario Lucic and Yi Tay and Adrian Weller and Mostafa Dehghani},
journal= {arXiv preprint arXiv:2111.12993},
year = {2021}
}