PAVE:视频大语言模型的修补与适配
计算机视觉与模式识别
2025-03-26 v1 人工智能
机器学习
摘要
预训练的视频大语言模型 展现出卓越的推理能力,然而将这些模型适配到涉及额外模态或数据类型(如音频或 3D 信息)的新任务仍具挑战性。在本文中,我们提出了 PAVE,一个用于将预训练 Video LLM 适配到带有边带信号(如音频、3D 线索或多视角视频)的下游任务的灵活框架。PAVE 引入了被称为“补丁”的轻量级适配器,在不改变基础模型架构或预训练权重的情况下,增加了少量参数和操作。通过这种方式,PAVE 能够有效地适配预训练基础模型以支持多样的下游任务,包括视听问答、3D 推理、多视角视频识别和高帧率视频理解。在这些任务中,PAVE 显著提升了基础模型的性能,超越了最先进的特定任务模型,同时仅产生约 0.1% 额外 FLOPs 和参数的微小成本。此外,PAVE 支持多任务学习,并在不同的 Video LLM 间具有良好的泛化能力。我们的代码可在 https://github.com/dragonlzm/PAVE 获取。
引用
@article{arxiv.2503.19794,
title = {PAVE: Patching and Adapting Video Large Language Models},
author = {Zhuoming Liu and Yiquan Li and Khoi Duc Nguyen and Yiwu Zhong and Yin Li},
journal= {arXiv preprint arXiv:2503.19794},
year = {2025}
}
备注
CVPR2025 Camera Ready