中文

GeoDANO:面向平面几何问题的几何视觉语言模型

计算机视觉与模式识别 2025-09-29 v2 计算与语言

摘要

我们介绍 GeoDANO,这是一个集成了领域无关视觉编码器的几何视觉语言模型 (VLM),用于解决平面几何问题。尽管视觉语言模型已被用于解决几何问题,但其识别几何特征的能力仍不足以被分析。为此,我们提出了一个基准,评估视觉几何特征的识别,包括如点、线等原始要素,以及如正交性等关系。我们的初步研究表明,常用于通用视觉语言模型的视觉编码器(如 OpenCLIP)往往无法检测这些特征,难以跨域泛化。为此,我们开发了 GeoCLIP,基于 CLIP 的模型,在合成几何图图-caption 对上进行训练。基准结果显示,GeoCLIP 在识别几何特征方面优于现有视觉编码器。随后,我们提出我们的 VLM,GeoDANO,将 GeoCLIP 增强为针对未知图表风格的领域适应策略。GeoDANO 在平面几何问题上超越专用方法,在 MathVerse 上 outperform GPT-4o。实现代码已公开于 https://github.com/ml-postech/GeoDANO。

引用

@article{arxiv.2502.11360,
  title  = {GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder},
  author = {Seunghyuk Cho and Zhenyue Qin and Yang Liu and Youngbin Choi and Seungbeom Lee and Dongwoo Kim},
  journal= {arXiv preprint arXiv:2502.11360},
  year   = {2025}
}

备注

Accepted to EMNLP-Findings 2025