HAVEN:用于统一视频理解的层次化对齐多模态基准
计算机视觉与模式识别
2026-05-20 v1
摘要
虽然多模态大语言模型(MLLM)在标准视频任务上表现出强大的性能,但其在总结和推理复杂叙事方面的能力仍未得到恰当评估。现有的总结基准将监督信息碎片化分布在孤立的粒度上,如关键帧、关键镜头或不连贯的文本摘要,未能捕捉跨模态对齐的本质层次结构。为此,我们提出HAVEN,这是一个用于统一视频理解的层次化对齐多模态基准。HAVEN pioneering(先驱)一种完全粒度(帧、镜头和视频水平)和完全多模态(视频和文本)数据集架构,包含模态之间显式的连续对齐。建立在这一统一标注范式之上,我们提出了一套全面的评估套件,涵盖总结、时间推理、多模态 grounding 和显著性排序。对现代MLLM的广泛基准测试揭示了表面级文本流畅性与扎实的多模态理解之间持久的差距。最终,HAVEN超越传统问答格式,为多模态系统的评估提供了严格、标准化的测试平台,以推动可解释、层次化视频理解的未来研究。我们公开发布了数据集、基准套件和评估协议。
引用
@article{arxiv.2605.19223,
title = {HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding},
author = {Mengqi Shi and Haopeng Zhang},
journal= {arXiv preprint arXiv:2605.19223},
year = {2026}
}