中文

AuroraCap:高效、 performant 的视频详细描述生成与新基准

计算机视觉与模式识别 2025-04-10 v4

摘要

视频详细描述生成是旨在生成全面且连贯视频内容文本描述的关键任务,旨于促进视频理解与生成。在本文中,我们提出 AuroraCap,一个基于大型多模态模型的视频描述生成器。我们遵循最简的体系结构设计,不为时序建模添加额外参数。为解决由冗长视频序列导致的开销,我们实现了 token 合并策略,减少输入视觉 token 的数量。令人惊讶的是,我们发现该策略导致的性能损失甚微。AuroraCap 在各种视频和图像描述基准测试中表现优异,例如在 Flickr30k 上获得 CIDEr 为 88.9,超越 GPT-4V (55.3) 和 Gemini-1.5 Pro (82.2)。然而,现有的视频描述基准仅包含简单描述,仅包含几十词,限制了该领域的研究。因此,我们开发了 VDC,一个拥有超过一千个精心标注的结构化视频详细描述基准。此外,我们提出一种新的 LLM 辅助度量 VDCscore 以提升评估,该度量采用分割-征服策略将长描述评估转化为多个短问答对。凭借人类 Elo 排名,我们的实验表明,该基准更能与人类对视频详细描述质量的判断相关联。

关键词

引用

@article{arxiv.2410.03051,
  title  = {AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark},
  author = {Wenhao Chai and Enxin Song and Yilun Du and Chenlin Meng and Vashisht Madhavan and Omer Bar-Tal and Jenq-Neng Hwang and Saining Xie and Christopher D. Manning},
  journal= {arXiv preprint arXiv:2410.03051},
  year   = {2025}
}

备注

Accepted to ICLR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://rese1f.github.io/aurora-web/