中文

Tarsier2:从细粒度视频描述到综合视频理解的大型视觉语言模型

计算机视觉与模式识别 2025-01-27 v3 人工智能

摘要

我们介绍 Tarsier2,一个用于生成详细且准确视频描述,同时展现出卓越通用视频理解能力的先进大型视觉语言模型 (LVLM)。Tarsier2 通过三项关键升级实现了显著进展:(1) 将预训练数据从 1100 万增至 4000 万视频文本对,丰富了数据量和多样性;(2) 在监督式微调期间进行细粒度的时间对齐;(3) 使用模型采样自动构建偏好数据并应用 DPO 训练进行优化。大量实验表明,Tarsier2-7B 在详细视频描述任务中持续优于领先的专有模型,包括 GPT-4o 和 Gemini 1.5 Pro。在 DREAM-1K 数据集上,Tarsier2-7B 相比 GPT-4o 提升 2.8 个百分点,相比 Gemini-1.5-Pro 提升 5.8 个百分点。在人类side-by-side评估中,Tarsier2-7B 相比 GPT-4o 优势 +8.6 个百分点,相比 Gemini-1.5-Pro 优势 +24.9 个百分点。Tarsier2-7B 还在 15 个公开基准测试中设下新纪录,涵盖视频问答、视频定位、幻觉测试和具身问答等任务,证明其作为强大的通用视觉语言模型的多样性。

关键词

引用

@article{arxiv.2501.07888,
  title  = {Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding},
  author = {Liping Yuan and Jiawei Wang and Haomiao Sun and Yuchen Zhang and Yuan Lin},
  journal= {arXiv preprint arXiv:2501.07888},
  year   = {2025}
}