基于蒙特卡洛树搜索评估多模态大语言模型在视频描述任务中的表现
计算机视觉与模式识别
2025-06-16 v1
摘要
视频描述可用于评估多模态大语言模型(MLLMs)的视频理解能力。然而,现有基准和评估协议存在诸多关键问题,如关键点创建不足或单一、数据创建成本高昂、评估范围有限。在针对这些问题的同时,我们提出了一种自动框架,命名为AutoCaption,利用蒙特卡洛树搜索(MCTS)构建大量且多样化的描述性句子(即关键点),全面代表视频内容。这种迭代式描述策略使我们能够持续增强视频细节,如动作、物体属性、环境细节等。在AutoCaption的基础上,我们构建了MCTS-VCB,一个覆盖视频细节的细粒度视频描述基准,进而实现对MLLMs在视频描述任务中的全面评估。我们在MCTS-VCB上评估了超过20个开源和闭源MLLMs,结果表明MCTS-VCB能够有效且全面地评估视频描述能力,Gemini-1.5-Pro获得最高的71.2分F1分数。有趣的是,我们使用AutoCaption生成的数据对InternVL2.5-8B进行微调,该模型在MCTS-VCB上实现整体提升25.0%,在DREAM-1K上提升16.3%,进一步证明了AutoCaption的有效性。代码和数据可在https://github.com/tjunlp-lab/MCTS-VCB上获取。
引用
@article{arxiv.2506.11155,
title = {Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search},
author = {Linhao Yu and Xinguang Ji and Yahui Liu and Fanheng Kong and Chenxi Sun and Jingyuan Zhang and Hongzhi Zhang and V. W. and Fuzheng Zhang and Deyi Xiong},
journal= {arXiv preprint arXiv:2506.11155},
year = {2025}
}
备注
28 pages; ACL 2025(main)