SCBench:面向视频大语言模型的体育解说基准
计算机视觉与模式识别
2024-12-24 v1 人工智能
摘要
最近,视频大语言模型 (Video LLM) 在学术界和工业界取得了显著进展。然而,针对不同 Video LLM 性能的评估方法和基准,尤其是其细粒度时序视觉能力,仍非常有限。一方面,当前的基准使用的是相对简单的视频 (如带字幕的电影片段),模型可以通过处理仅少数帧即可理解整个视频。另一方面,这些数据集在任务格式上缺乏多样性,仅包含问答或多选问答,忽略了模型生成深入精确文本的能力。体育视频具有复杂的视觉信息、连续的事件以及情感强烈的解说内容,为 Video LLM 提出了关键挑战,使体育解说成为理想的基准任务。针对这些挑战,我们提出了一种新任务:体育视频解说生成,基于此构建了用于 Video LLM 的 SCBench。为构建此基准,我们引入了 (1) 为本任务专门设计的六维评估指标 SCOREs,基于此提出了基于 GPT 的评估方法;以及 (2) 包含 5775 个标注视频剪辑和针对该指标量身定制的ground-truth标签的 CommentarySet 数据集。基于 SCBench,我们对多个 Video LLM (如 VILA、Video-LLaVA 等) 进行了全面评估,并测试了链式思考基线方法。我们的结果发现,InternVL-Chat-2 实现了最佳性能,得分为 5.44,领先于第二名的 1.04。我们的工作为未来的研究提供了新的视角,旨在提升模型在复杂视觉理解任务中的整体能力。我们的数据集将很快公开。
引用
@article{arxiv.2412.17637,
title = {SCBench: A Sports Commentary Benchmark for Video LLMs},
author = {Kuangzhi Ge and Lingjun Chen and Kevin Zhang and Yulin Luo and Tianyu Shi and Liaoyuan Fan and Xiang Li and Guanqun Wang and Shanghang Zhang},
journal= {arXiv preprint arXiv:2412.17637},
year = {2024}
}