MMGeoLM:面向大型多模态模型细粒度几何理解的困难负样本对比学习
计算机视觉与模式识别
2025-10-02 v3 人工智能
计算与语言
摘要
大型多模态模型 (LMM) 通常基于 ViT(例如 CLIP)构建,然而其使用简单随机批内负样本的训练方式限制了其捕捉细粒度视觉差异的能力,尤其是在几何场景中。为了应对这一挑战,我们为视觉编码器提出了一种新颖的困难负样本对比学习框架,该框架结合了使用通过扰动图表生成代码生成的困难负样本的基于图像的对比学习,以及使用源自修改后的几何描述的基于规则的负样本和基于字幕相似度选择的基于检索的负样本的基于文本的对比学习。我们使用我们的困难负样本训练方法训练了一个视觉编码器 (CLIP),即 MMCLIP (Multimodal Math CLIP),随后训练了一个用于几何问题求解的 LMM。实验表明,我们训练的模型 MMGeoLM 在三个几何推理基准上显著优于其他开源模型。即使参数量仅为 7B,它也能匹敌如 GPT-4o 等强大的闭源模型。我们进一步进行了消融研究,以分析三个关键因素:困难负样本类型、基于图像的负样本的有效性以及训练配置。这些分析为优化视觉编码器在细粒度几何推理任务上的训练流程提供了重要见解。https://github.com/THU-KEG/MMGeoLM。
引用
@article{arxiv.2505.20152,
title = {MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models},
author = {Kai Sun and Yushi Bai and Zhen Yang and Jiajie Zhang and Ji Qi and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2505.20152},
year = {2025}
}