基于图像语言基础模型的图像到视频迁移学习综述
计算机视觉与模式识别
2026-01-21 v3 人工智能
摘要
图像语言基础模型(Image-Language Foundation Models, ILFMs)在视觉语言理解方面展现出显著的成功,提供了可跨越多种下游图像任务的可迁移多模态表示。视频文本研究的进步催生了将图像模型扩展至视频领域的日益浓厚兴趣。这种范式称为图像到视频迁移学习,能够在不从头训练视频语言模型的情况下,有效缓解了大规模数据和计算资源的需求,而且能够实现与甚至超过不使用迁移学习的模型相当或更好的性能。本综述提供了该新兴领域的首个全面综述,首先概述了广泛使用的ILFMs及其功能。随后,我们基于将图像理解能力迁移到视频任务的迁移方式,将现有图像到视频迁移学习技术系统分类为两大根本类别(冻结特征和调整特征),以及诸多细分子类别。基于图像到视频迁移的任务特定性,本综述系统阐述了这些策略,并详细描述了其在从细粒度场景(如时空视频定位)到粗粒度场景(如视频问答)等多种视频文本学习任务中的应用。我们进一步提供了详尽的实验分析,以探讨不同图像到视频迁移学习范式在多种下游视频理解任务上的有效性。最后,我们识别出当前面临的挑战,并指出未来研究的有前景的方向。通过提供全面且结构化的概览,本综述旨在为基于现有ILFM的视频文本学习建立结构化路线图,并激发该快速演进领域的未来研究方向。GitHub仓库已公开。
引用
@article{arxiv.2510.10671,
title = {Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey},
author = {Jinxuan Li and Chaolei Tan and Haoxuan Chen and Jianxin Ma and Jian-Fang Hu and Jianhuang Lai and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2510.10671},
year = {2026}
}
备注
Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer