FineBench:面向细粒度人类活动理解的视觉语言模型基准评测与增强
摘要
视觉语言模型(Vision-Language Models, VLMs)在通用视频理解中展现出卓越能力,但在需要精细解读人类动作与交互的现实应用中,它们往往难以实现关键的细粒度理解。尽管近期一些以人为中心的基准评测了模型行为的某些方面,如公平性/伦理、情感感知及更广泛的人本指标,但它们并未将长视频、高密度问答覆盖以及帧级时空定位大规模地结合起来。为弥补这一差距,我们引入了 FineBench,一个专为评估细粒度理解而设计的以人为中心的视频问答(Video Question Answering, VQA)基准。FineBench 包含 199,420 个多项选择问答对,密集标注于 64 个长视频(每个 15 分钟)之上,重点关注详细的人物运动、人物交互及物体操作,包括组合性动作。我们广泛的评估表明,尽管 GPT-5 等闭源模型取得了可观的性能,但当前的开源视觉语言模型表现明显不佳,尤其在多人场景的空间推理以及区分人类运动与交互的细微差异方面存在困难。为解决这些已识别的弱点,我们提出了 FineAgent,一个通过利用定位器(Localizer)和描述器(Descriptor)来增强视觉语言模型的模块化框架。实验表明,FineAgent 持续提升了多种开源视觉语言模型在 FineBench 上的性能。FineBench 为未来细粒度以人为中心的视频理解研究提供了严格的测试平台,而 FineAgent 则为增强当前视觉语言模型中的此类推理能力提供了一种实用方法。项目页面与代码见 https://joslefaure.github.io/assets/html/finebench.html。
引用
@article{arxiv.2605.19846,
title = {FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding},
author = {Gueter Josmy Faure and Min-Hung Chen and Jia-Fong Yeh and Hung-Ting Su and Winston H. Hsu},
journal= {arXiv preprint arXiv:2605.19846},
year = {2026}
}
备注
CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html