FIOVA:一个用于人类对齐视频描述的多标注者基准
计算机视觉与模式识别
2025-05-20 v2
摘要
尽管大型视觉语言模型(LVLM)取得了快速进展,但现有的视频描述基准在评估其与人类理解的一致性方面仍然存在局限性。大多数基准依赖于每个视频的单一标注和基于词汇相似性的度量,未能捕捉人类感知的变异性和事件的认知重要性。这些局限性阻碍了对模型生成连贯、完整且与人类对齐的描述能力的准确诊断。为了解决这个问题,我们引入了FIOVA(五合一视频标注),这是一个专为评估而设计的人类中心基准。它包含3,002个真实世界视频(每个约33.6秒),每个视频由五名标注者独立标注。这种设计能够对语义多样性和主体间一致性进行建模,为衡量人机对齐提供了更丰富的基础。我们进一步提出了FIOVA-DQ,一种事件级评估度量,它结合了从标注者共识中得出的认知权重,提供了对事件相关性和语义覆盖度的细粒度评估。利用FIOVA,我们对九个具有代表性的LVLM进行了全面评估,并引入了一个基于标注者间变异系数(CV)的复杂度感知分析框架。这揭示了不同难度级别下的一致性差距,并识别了诸如事件描述不足和模板趋同等结构性问题。我们的结果凸显了FIOVA在理解LVLM在不同复杂度下行为方面的诊断价值,为长视频描述中的认知对齐评估设立了新标准。该基准、标注、度量和模型输出已公开发布,以支持未来视频理解领域以评估为导向的研究。更多详细信息请访问https://huuuuusy.github.io/fiova/。
引用
@article{arxiv.2410.15270,
title = {FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning},
author = {Shiyu Hu and Xuchen Li and Xuzhao Li and Jing Zhang and Yipei Wang and Xin Zhao and Kang Hao Cheong},
journal= {arXiv preprint arXiv:2410.15270},
year = {2025}
}