ViMU:视频隐喻理解基准测试
计算机视觉与模式识别
2026-05-15 v1 计算机与社会
摘要
任何新媒介一旦出现,其用途就不仅仅局限于传递表层内容。它所携带的信息通常在两个层面上运作:一是直接呈现的内容,二是其背后的潜台词——创作者试图通过媒介传达的隐含思想和意图。同样,自从视频技术被广泛采用以来,视频不仅作为记录和交流视觉信息的强大工具,也作为情感、态度和社会意义的载体,而这些往往难以明确表达。因此,许多视频的真正含义不仅仅存在于屏幕上显示的内容中;它通常嵌入在上下文、表达方式和观众的社会经验中。此类视频潜台词的某些形式是幽默的,而另一些则带有讽刺、嘲弄或批评。这些隐含含义在不同的文化背景和社会群体中也可能有截然不同的解释。然而,大多数现有的视频理解模型仍然主要集中在字面视觉理解上,例如识别物体、动作或时间关系,缺乏系统理解视频中嵌入的隐喻、讽刺和社会意义的能力。为了弥合这一差距,我们引入了 ViMU,这是第一个旨在系统评估前沿模型在视频中潜台词理解能力的基准。ViMU 评估视频理解模型是否能超越字面感知来推断隐含含义,同时将其解释建立在多模态证据基础上,并回答开放式和多项选择题。重要的是,所有问题都被设计为无提示的,确保在回答前不会向模型透露任何关键证据。
引用
@article{arxiv.2605.14607,
title = {ViMU: Benchmarking Video Metaphorical Understanding},
author = {Qi Li and Xinchao Wang},
journal= {arXiv preprint arXiv:2605.14607},
year = {2026}
}