中文

视觉编码器能学会看见箭头吗?

计算机视觉与模式识别 2025-05-27 v1 人工智能 计算与语言 机器学习

摘要

图表是用边(线或箭头)表示关系的可视化形式,广泛应用于工业和科学交流中。尽管识别图表对于视觉语言模型(VLM)理解领域特定知识至关重要,但最近的研究表明,许多VLM无法识别图像中的边。我们假设这些失败源于对文本和位置偏差的过度依赖,阻碍了VLM学习显式的边特征。基于这一想法,我们实证研究了VLM中的图像编码器能否通过在既无文本偏差也无位置偏差的图表数据集上训练来学习边表示。为此,我们在人工生成的图表-描述数据集上进行对比学习以训练图像编码器,并在三个任务上评估其与图表相关的特征:探测、图像检索和图像描述。结果表明,微调后的模型在所有任务中均优于预训练的CLIP,并在图像描述任务中超越了零样本的GPT-4o和LLaVA-Mistral。这些发现证实,消除文本和位置偏差有助于VLM进行准确的边识别,为推进图表理解提供了一条有前景的路径。

关键词

引用

@article{arxiv.2505.19944,
  title  = {Can Visual Encoder Learn to See Arrows?},
  author = {Naoyuki Terashita and Yusuke Tozaki and Hideaki Omote and Congkha Nguyen and Ryosuke Nakamoto and Yuta Koreeda and Hiroaki Ozaki},
  journal= {arXiv preprint arXiv:2505.19944},
  year   = {2025}
}

备注

This work has been accepted for poster presentation at the Second Workshop on Visual Concepts in CVPR 2025