ChromouVQA:基于色彩伪装图像的视觉语言模型基准测试
计算机视觉与模式识别
2025-12-08 v1 人工智能
摘要
视觉语言模型(VLM)在多模态理解方面取得了进展,但在目标嵌入在需要图底分离的杂乱背景中时仍感到挑战。为此,我们提出 ChromouVQA,这是一个基于仪式式色彩伪装图像的大规模、多任务基准测试。我们将经典的点图板扩展为多种填充几何形状,并变更色度分离、密度、大小、遮挡和旋转,记录完整的元数据以便可重复。该基准涵盖九个视觉-问题-答案任务,包括识别、计数、比较和空间推理。人类和 VLM 的评估显示存在较大差距,尤其是在细微色度对比或干扰性几何填充时。我们还提出一种模型无关的对比配方,将轮廓与其伪装渲染对齐,以改善全局形状的恢复。ChromouVQA 提供了一个紧凑、受控的基准测试,用于可重复的评估和扩展。代码和数据集可在 https://github.com/Chromou-VQA-Benchmark/Chromou-VQA 上获取。
引用
@article{arxiv.2512.05137,
title = {ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images},
author = {Yunfei Zhang and Yizhuo He and Yuanxun Shao and Zhengtao Yao and Haoyan Xu and Junhao Dong and Zhen Yao and Zhikang Dong},
journal= {arXiv preprint arXiv:2512.05137},
year = {2025}
}