KARMA-MV: 一个关于音乐视频因果问答的基准
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
尽管视频问答和跨模态理解取得了显著进展,但关于视觉动态如何驱动音乐视频中音乐结构的因果推理仍未得到充分探索。我们引入了 KARMA-MV,一个源自 2,682 个 YouTube 音乐视频的大规模多项选择 QA 数据集,旨在测试模型整合时序音视频线索并跨推理、预测和反事实问题推理视觉对音乐影响的能力。与传统需要人工标注的数据集不同,KARMA-MV 利用 LLM 推理进行可扩展的生成和验证,产生了 37,737 个 MCQ。我们提出了一种因果知识图谱 (CKG) 方法,通过跨模态依赖的结构化检索来增强视觉-语言模型 (VLM)。在最先进的 VLM 和 LLM 上的实验表明,CKG 接地带来了持续的增益——尤其是对于较小的模型——确立了显式因果结构对于音乐视频推理的价值。KARMA-MV 为推进超越相关性的因果音视频理解提供了一个新的基准。
引用
@article{arxiv.2605.08175,
title = {KARMA-MV: A Benchmark for Causal Question Answering on Music Videos},
author = {Archishman Ghosh and Abhinaba Roy and Dorien Herremans},
journal= {arXiv preprint arXiv:2605.08175},
year = {2026}
}