中文

SPARK:面向大规模视觉语言模型的多视觉传感器感知与推理基准

计算机视觉与模式识别 2024-10-14 v3

摘要

大规模视觉语言模型(LVM)通过文本对齐的视觉输入取得了显著进展。它们在计算机视觉任务中通过将文本模态与视觉输入对齐取得了显著的进展。也有尝试将多种视觉传感器纳入其中,包括热成像、深度和医学X光图像。然而,我们注意到当前LVM将来自多视觉传感器的图像视为同一RGB域,却未考虑多视觉传感器的物理特性。它们未能正确地传达数据集中来自多视觉传感器的信息以及相应的上下文知识。因此,无法正确地在实际物理环境与文本之间实现对信息的对齐,难以回答需要考虑物理环境的复杂传感器相关问题。本文旨在建立一个多视觉传感器感知与推理基准,称为SPARK,以缩小图像与多视觉传感器之间根本的多视觉传感器信息差。我们生成了6,248个视觉语言测试样本,以探究跨不同格式的多视觉感知与推理能力,涵盖不同类型的传感器相关问题。我们利用这些样本评估了十个领先的LVM。结果显示,大多数模型在不同程度上在多视觉感知推理方面存在不足。代码和数据已公开于https://github.com/top-yun/SPARK

关键词

引用

@article{arxiv.2408.12114,
  title  = {SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models},
  author = {Youngjoon Yu and Sangyun Chung and Byung-Kwan Lee and Yong Man Ro},
  journal= {arXiv preprint arXiv:2408.12114},
  year   = {2024}
}

备注

Codes and data are available at https://github.com/top-yun/SPARK