中文

GeoFocus: 融合高效全局到局部感知的多模态几何问题求解

计算机视觉与模式识别 2026-02-10 v1

摘要

几何问题求解对大型多模态模型而言仍是一项重大挑战,不仅需要全局形状识别,还需要关注与几何理论相关的复杂局部关系。为此,我们提出GeoFocus,一个包含两个核心模块的新颖框架。1) 关键局部感知器,通过十三个基于理论的感知模板自动识别并强调关键局部结构(例如,角度、平行线、比较距离),与先前方法相比,将关键局部特征覆盖率提升了61%。2) VertexLang,一种紧凑的拓扑形式语言,通过顶点坐标和连接关系对全局图形进行编码。通过替换冗长的基于代码的编码,VertexLang将全局感知训练时间减少了20%,同时提高了拓扑识别准确率。在Geo3K、GeoQA和FormalGeo7K上的评估中,GeoFocus相比领先的专用模型实现了4.7%的准确率提升,并在MATHVERSE中展示了在不同视觉条件下的卓越鲁棒性。项目页面 -- https://github.com/dle666/GeoFocus

关键词

引用

@article{arxiv.2602.08524,
  title  = {GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving},
  author = {Linger Deng and Yuliang Liu and Wenwen Yu and Zujia Zhang and Jianzhong Ju and Zhenbo Luo and Xiang Bai},
  journal= {arXiv preprint arXiv:2602.08524},
  year   = {2026}
}