中文

TOPA:通过纯文本预对齐扩展大语言模型用于视频理解

计算机视觉与模式识别 2024-11-05 v2 人工智能 计算与语言

摘要

图像理解的最新进展得益于网络图像-文本对的广泛使用。然而,尽管有大量网络视频-文本数据,视频理解仍然是一个挑战。这一困难主要源于视频固有的复杂性以及近期网络收集的视频-文本数据集中低效的语言监督。在本文中,我们介绍纯文本预对齐(TOPA),一种无需在真实视频数据上预训练即可扩展大语言模型用于视频理解的新方法。具体来说,我们首先使用先进的大语言模型自动生成包含连续文本帧的文本视频,以及相应的标注,以模拟真实的视频-文本数据。然后,这些标注的文本视频用于将纯语言大语言模型与视频模态进行预对齐。为弥合文本视频与真实视频之间的差距,我们采用CLIP模型作为特征提取器来对齐图像和文本模态。在纯文本预对齐过程中,连续文本帧被编码为CLIP文本特征序列,类似于连续的CLIP图像特征,从而使大语言模型与真实视频表示对齐。大量实验,包括在各种视频理解任务上的零样本评估和微调,表明TOPA是一种将视频内容与大语言模型对齐的有效且高效的框架。特别是,在未训练任何视频数据的情况下,TOPA-Llama2-13B模型在具有挑战性的长视频理解基准Egoschema上达到了51.0%的Top-1准确率。这一性能超越了之前的视频-文本预训练方法,并与近期基于GPT-3.5的视频智能体相媲美。

关键词

引用

@article{arxiv.2405.13911,
  title  = {TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment},
  author = {Wei Li and Hehe Fan and Yongkang Wong and Mohan Kankanhalli and Yi Yang},
  journal= {arXiv preprint arXiv:2405.13911},
  year   = {2024}
}

备注

NeurIPS 2024 (Spotlight)