中文

LLMVA-GEBC:基于视频适配器的大语言模型通用事件边界描述

计算机视觉与模式识别 2025-10-09 v2 计算与语言

摘要

本文详述我们在 CVPR 2023 通用事件边界描述(GEBC)竞赛中的获奖方案。与传统视频描述任务不同,GEBC 要求描述模型理解指定视频边界附近状态的即时变化,因而是一项困难任务。本文提出一种有效模型 LLMVA-GEBC(基于视频适配器的大语言模型通用事件边界描述):(1) 我们利用预训练 LLM 生成高质量类人描述;(2) 为使模型适配 GEBC 任务,我们采用 video Q-former 作为适配器,并与冻结的视觉特征提取器和 LLM 一同训练。所提方法在测试集上取得 76.14 分,并在该挑战赛中获第一名。代码见 https://github.com/zjr2000/LLMVA-GEBC。

关键词

引用

@article{arxiv.2306.10354,
  title  = {LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning},
  author = {Yolo Yunlong Tang and Jinrui Zhang and Xiangchen Wang and Teng Wang and Feng Zheng},
  journal= {arXiv preprint arXiv:2306.10354},
  year   = {2025}
}

备注

Winner solution to Generic Event Boundary Captioning task in LOVEU Challenge (CVPR 2023 workshop)