中文

ReMI:用于多图像推理的数据集

计算机视觉与模式识别 2024-06-14 v1 计算与语言

摘要

随着大型语言模型(LLM)持续发展,创建新的基准以有效评估其不断扩充的能力并确定改进领域变得至关重要。本工作聚焦于多图像推理,这是最新前沿 LLM 中的一种新兴能力。我们引入了 ReMI 数据集,用于评估 LLM 进行 多图像推理的能力。该数据集涵盖了数学、物理、逻辑、代码、表格/图表理解以及空间和时间推理等多种推理任务,还涵盖了多图像推理场景中所见的广泛特征。我们使用 ReMI 对几种最前沿的 LLM 进行基准测试,发现其性能与人类水平之间存在显著差距。这凸显了多图像推理的挑战以及进一步研究的必要性。我们的分析还揭示了不同模型的优势与不足,为当前可实现的推理类型以及未来模型需要改进的领域提供了见解。为促进该领域的进一步研究,我们将公开发布 ReMI:https://huggingface.co/datasets/mehrankazemi/ReMI。

关键词

引用

@article{arxiv.2406.09175,
  title  = {ReMI: A Dataset for Reasoning with Multiple Images},
  author = {Mehran Kazemi and Nishanth Dikkala and Ankit Anand and Petar Devic and Ishita Dasgupta and Fangyu Liu and Bahare Fatemi and Pranjal Awasthi and Dee Guo and Sreenivas Gollapudi and Ahmed Qureshi},
  journal= {arXiv preprint arXiv:2406.09175},
  year   = {2024}
}