中文

Contra4:评估音频、视频、图像与3D中的对比跨模态推理

人工智能 2025-09-17 v2

摘要

现实世界的决策往往始于识别哪个模态包含与给定查询最相关的信息。尽管近期多模态模型在处理多样化输入方面取得了显著进展,但它们能否跨多个模态进行对比推理以选择最满足自然语言提示的模态,仍不清楚。我们认为这一能力是基础性的,尤其是在检索增强和决策时刻的上下文中,系统必须评估多个信号并识别哪一个传递了相关信息。为了评估这一技能,我们引入了 Contra4,一个用于跨四种模态(图像、音频、视频和 3D)对比跨模态推理的数据集。每个示例呈现一个自然语言问题以及多个候选模态实例,模型必须选择在语义上与提示对齐的实例。Contra4 结合人工标注的描述与混合模型往返一致性过滤器以确保高质量监督,最终产生 174k 训练样本和 2.3k 人工验证的测试集。尽管任务特定的微调有助于将性能相对基线提升 56%,但最先进的模型在总体上仅达到 56% 的绝对准确率,在四模态设置下仅为 42%,凸显了当前多模态模型的显著局限性。

关键词

引用

@article{arxiv.2506.01275,
  title  = {Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D},
  author = {Artemis Panagopoulou and Le Xue and Honglu Zhou and silvio savarese and Ran Xu and Caiming Xiong and Chris Callison-Burch and Mark Yatskar and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2506.01275},
  year   = {2025}
}