中文

AIM:适配图像模型以实现高效视频动作识别

计算机视觉与模式识别 2023-02-07 v1

摘要

近期基于vision transformer的视频模型大多遵循“图像预训练再微调”的范式,并在多个视频基准上取得了巨大成功。然而,考虑到预训练图像transformer模型已展现出卓越的可迁移性,对此类视频模型进行全量微调可能计算代价高昂且并无必要。本工作中,我们提出一种新方法,将预训练图像模型适配(Adapting Image Models, AIM)用于高效视频理解。通过冻结预训练图像模型并添加少量轻量级Adapter,我们引入空间适配、时间适配和联合适配,逐步赋予图像模型时空推理能力。我们表明,在四个视频动作识别基准上,我们提出的AIM可用大幅更少的可调参数达到与先前方法相当甚至更优的性能。得益于其简洁性,我们的方法也普遍适用于不同的图像预训练模型,未来有潜力利用更强大的图像基础模型。项目主页为\url{https://adapt-image-models.github.io/}。

关键词

引用

@article{arxiv.2302.03024,
  title  = {AIM: Adapting Image Models for Efficient Video Action Recognition},
  author = {Taojiannan Yang and Yi Zhu and Yusheng Xie and Aston Zhang and Chen Chen and Mu Li},
  journal= {arXiv preprint arXiv:2302.03024},
  year   = {2023}
}

备注

Accepted to ICLR 2023. Project webpage is at https://adapt-image-models.github.io/