All-in-one:基于 MAIA 基准的多模态推理中的理解与生成
计算与语言
2025-09-23 v3
摘要
我们介绍了 MAIA (Multimodal AI Assessment),这是一个原生意大利语基准,旨在对视觉语言模型在视频上的推理能力进行细粒度研究。MAIA 在其设计、推理类别、使用的指标以及视频的语言和文化方面不同于其他可用的视频基准。MAIA 在两个对齐的任务上评估视觉语言模型 (VLMs):视觉陈述验证任务和开放式视觉问答任务,两者均基于同一组与视频相关的问题。它考虑了十二个推理类别,旨在通过突出视觉输入的作用来解耦语言与视觉关系。得益于其精心设计,它通过一个聚合指标同时评估了 VLM 的一致性以及视觉基础自然语言理解与生成能力,该指标显示的较低结果突显了模型的脆弱性。最后同样重要的是,视频集经过精心挑选以反映意大利文化,且语言数据由母语者产生。
引用
@article{arxiv.2502.16989,
title = {All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark},
author = {Davide Testa and Giovanni Bonetta and Raffaella Bernardi and Alessandro Bondielli and Alessandro Lenci and Alessio Miaschi and Lucia Passaro and Bernardo Magnini},
journal= {arXiv preprint arXiv:2502.16989},
year = {2025}
}
备注
Accepted at Findings of EMNLP 2025