中文

迈向通用人工教师:基于视觉语言模型的程序化几何数据生成与视觉锚定

计算机视觉与模式识别 2026-04-06 v1 人工智能 机器学习

摘要

我们将几何教育中的视觉解释研究为一个引用图像分割(Referring Image Segmentation, RIS)问题:给定一个图示和自然语言描述,任务是生成所指几何元素的像素级掩码。然而,在自然图像基准(如 RefCOCO)上训练的现有 RIS 模型由于摄影场景与抽象、无纹理示意图之间的根本域偏移,在几何图上表现灾难性地差。为解决合适训练数据缺失的问题,我们提出了一种完全自动化的程序化数据引擎,可生成超过 200,000 张合成几何图,包含像素级精确的分割掩码和语言多样的引用表达式,无需任何人工标注。我们进一步提出针对视觉语言模型(VLMs)的领域特定微调,证明微调后的 Florence-2 实现了 49% 的 IoU 和 85% 的缓冲交并比(BIoU),而零样本设置下的 IoU 不足 1%。我们引入了缓冲交并比(Buffered IoU),这是一种考虑薄结构定位的几何感知评估指标,并证明它比标准 IoU 更能反映真实的分割质量。我们的结果为构建能够提供视觉锚定的、逐步解释几何问题的通用人工教师(AGTs)奠定了基础。

关键词

引用

@article{arxiv.2604.02893,
  title  = {Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models},
  author = {Hai Nguyen-Truong and Alper Balbay and Tunga Bayrak},
  journal= {arXiv preprint arXiv:2604.02893},
  year   = {2026}
}

备注

12 pages, 7 figures