中文

MegaCOIN: 提升视觉语言模型中中等粒度颜色感知能力

计算机视觉与模式识别 2024-12-06 v1 机器学习

摘要

在视觉语言模型(VLM)中,感知和解释颜色及物理环境的能力对于实现上下文准确理解和与之交互至关重要。然而,尽管多模态建模取得了进展,仍存在显著缺口,即缺乏专门的数据集来严格评估模型区分细微颜色变化和空间上下文的能力——这些是 situational comprehension 和可靠部署到实际应用中的关键要素。为此目标,我们策划了MegaCOIN,一个基于\emph{真实}图像、包含various上下文属性的高质量、人工标注数据集。MegaCOIN由两部分组成:MegaCOIN-Instruct 作为监督式微调(SFT)数据集用于VLM;MegaCOIN-Bench 作为标注测试集可作为独立的问答数据集使用。MegaCOIN提供三项标注特征,覆盖22万张真实图像:前景颜色、背景颜色以及对物体物理环境的描述,总计66万人工标注。此外,MegaCOIN可用于评估领域泛化(DG)算法。我们在VLM上进行线性探针设置下的DG方法基准测试,并展示了一些新见解。最后,我们指出VLM(包括GPT-4o)在颜色识别方面表现不佳,通过MegaCOIN微调可提升视觉评估任务中的性能。在某些情况下,MegaCOIN微调后的小规模开源模型如LLaVA和Bunny甚至可以超越闭源GPT-4o。我们希望MegaCOIN的实用性能够为VLM的改进方向提供启发,并为领域泛化算法提供更复杂的平台。

关键词

引用

@article{arxiv.2412.03927,
  title  = {MegaCOIN: Enhancing Medium-Grained Color Perception for Vision-Language Models},
  author = {Ming-Chang Chiu and Shicheng Wen and Pin-Yu Chen and Xuezhe Ma},
  journal= {arXiv preprint arXiv:2412.03927},
  year   = {2024}
}

备注

8 pages, 13 tables, 2 figures