PLLaVA:从图像到视频的无参数 LLaVA 扩展用于视频密集描述
计算机视觉与模式识别
2024-04-30 v2
摘要
视觉-语言预训练显著提升了各种图像-语言应用的性能。然而,与视频相关任务的预训练过程需要极其庞大的计算和数据资源,这阻碍了视频-语言模型的发展。本文研究了一种直接、高效且轻量的方法,将现有的图像-语言预训练模型适配用于密集视频理解。我们的初步实验表明,在视频数据集上以多帧作为输入直接微调预训练的图像-语言模型,会导致性能饱和甚至下降。进一步的调查表明,这在很大程度上归因于所学到的具有高范数视觉特征的偏差。受此发现启发,我们提出了一种简单但有效的池化策略,以平滑沿时间维度的特征分布,从而减少极端特征的主导影响。新模型被称为 Pooling LLaVA,简称 PLLaVA。PLLaVA 在现代基准数据集上的视频问答和描述任务中均取得了新的 SOTA 性能。值得注意的是,在近期流行的 VideoChatGPT 基准上,PLLaVA 在五个评估维度的平均得分为 5 分制中的 3.48 分,比 GPT4V (IG-VLM) 之前的 SOTA 结果高出 9%。在最新的多选基准 MVBench 上,PLLaVA 在 20 个子任务中的平均准确率达到 58.1%,比 GPT4V (IG-VLM) 高出 14.5%。代码可在 https://pllava.github.io/ 获取。
引用
@article{arxiv.2404.16994,
title = {PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning},
author = {Lin Xu and Yilin Zhao and Daquan Zhou and Zhijie Lin and See Kiong Ng and Jiashi Feng},
journal= {arXiv preprint arXiv:2404.16994},
year = {2024}
}