TUNA:在密集动态视频上的全面细粒度时序理解评估
计算机视觉与模式识别
2025-06-10 v2 多媒体
摘要
视频的独特之处在于其整合了包括摄像机、场景、动作和属性在内的时序元素,以及它们随时间变化的动态关系。然而,现有的视频理解基准通常将这些属性分开处理或狭隘地关注特定方面,忽略了视频内容的整体性。为了解决这个问题,我们引入了 TUNA,这是一个面向密集动态视频细粒度理解的时序导向基准,包含两项互补任务:字幕生成和问答。我们的 TUNA 具有多样化的视频场景和动态,并辅以可解释且稳健的评估标准。我们在基准上评估了几个领先模型,提供了跨各种维度的细粒度性能评估。这项评估揭示了视频时序理解中的关键挑战,如有限的动作描述、不充分的多主体理解以及对摄像机运动的不敏感,为改进视频理解模型提供了有价值的见解。数据和代码可在 https://friedrichor.github.io/projects/TUNA 获取。
引用
@article{arxiv.2505.20124,
title = {TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos},
author = {Fanheng Kong and Jingyuan Zhang and Hongzhi Zhang and Shi Feng and Daling Wang and Linhao Yu and Xingguang Ji and Yu Tian and Victoria W. and Fuzheng Zhang},
journal= {arXiv preprint arXiv:2505.20124},
year = {2025}
}
备注
Accepted to ACL 2025 Main. Project page: https://friedrichor.github.io/projects/TUNA