OIG-Bench:用于多智能体标注的多模态一图指南理解基准
计算机视觉与模式识别
2025-10-02 v1
摘要
近期多模态大语言模型(MLLMs)在各类任务中展现出惊人的能力,但其在 One-Image Guides 领域的人类式理解能力评估仍不足。One-Image Guides 是一种结合文本、图像和符号的视觉格式,用于呈现重新组织和结构化的信息,以便更易于理解,专为人类观看而设计,本质上体现了人类感知和理解的特征。为此,我们提出了 OIG-Bench,一个聚焦于 One-Image Guide 理解的综合性基准测试,覆盖多个领域。为降低人工标注成本,我们开发了半自动化标注管道,由多个智能代理协作生成初始图像描述,辅助人类构建图像-文本对。借助 OIG-Bench,我们对 29 个最先进的 MLLMs(包括专有和开源模型)进行了全面评估。结果显示,Qwen2.5-VL-72B 在所评估模型中表现最佳,整体准确率达 77%。然而,所有模型在语义理解和逻辑推理方面均表现出显著不足,表明当前 MLLMs 在准确解释复杂视觉-文本关系方面仍面临挑战。此外,我们还展示了所提出的多智能体标注系统在图像描述生成方面优于所有 MLLMs,凸显其作为高质量图像描述生成器及未来数据集构建工具的潜力。数据集可在 https://github.com/XiejcSYSU/OIG-Bench 获取。
引用
@article{arxiv.2510.00069,
title = {OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding},
author = {Jiancong Xie and Wenjin Wang and Zhuomeng Zhang and Zihan Liu and Qi Liu and Ke Feng and Zixun Sun and Yuedong Yang},
journal= {arXiv preprint arXiv:2510.00069},
year = {2025}
}