Tarsier:训练与评估大型视频描述模型的配方
计算机视觉与模式识别
2024-09-25 v2 机器学习
摘要
生成细粒度视频描述是视频理解中的一个基本挑战。本文介绍Tarsier,一个大规模视频语言模型家族,旨在生成高质量的视频描述。Tarsier采用CLIP-ViT对帧进行单独编码,然后使用LLM来建模时间关系。尽管其结构简单,我们展示了通过精心设计的两阶段训练程序,Tarsier模型在视频描述能力上显著优于任何现有开源模型,在人类side-by-side评估中相对于最强模型实现+51.4%的优势。此外,它们与当前专有模型相当,相对于GPT-4V优势+12.3%,相对于Gemini 1.5 Pro劣势-6.7%。当通过构建于SigLIP和Qwen2-7B的Tarsier2升级后,在相对于GPT-4o方面实现+4.8%的优势。除了视频描述,Tarsier证明是一个通用型模型,在包括多选VQA、开放式VQA和零样本视频字幕等九个公共基准测试中实现了新的最先进结果。我们的第二个贡献是引入一个新的基准测试——DREAM-1K(https://tarsier-vlm.github.io/),用于评估视频描述模型,包含来自多样来源且复杂度不同的新挑战数据集,以及专为评估细粒度视频描述质量而设计的自动方法。我们将模型和评估基准公开于https://github.com/bytedance/tarsier。
引用
@article{arxiv.2407.00634,
title = {Tarsier: Recipes for Training and Evaluating Large Video Description Models},
author = {Jiawei Wang and Liping Yuan and Yuchen Zhang and Haomiao Sun},
journal= {arXiv preprint arXiv:2407.00634},
year = {2024}
}