中文

从 LLM 蒸馏视觉图表推理能力至 MLLM

计算机视觉与模式识别 2025-12-10 v3

摘要

解决复杂图表问答任务需要多模态大语言模型 (MLLM) 具备高级视觉推理能力,包括从视觉输入中识别关键信息并对其进行推理。虽然针对推理进行微调 MLLM 至关重要,但收集和标注图表和问题的成本高、难以扩张,常导致标注质量低下。为此,我们提出了代码-中介翻译 (CIT),一种面向从 LLM 蒸馊视觉推理能力至 MLLM 的成本低、高效且可扩展的数据合成方法。代码作为中介,将视觉图表表示翻译为文本表示,使语言模型能够理解跨模态信息并生成推理链。如此,我们可以运用基于文本的合成技术扩展图表绘制代码并生成高质量问答对用于训练模型。此过程产生了 ReachQA 数据集,包含 3000 个推理密集型图表和 20000 个问答对,以增强 MLLM 的识别和推理能力。实验表明,使用 ReachQA 微调的模型不仅在图表相关任务中表现良好,而且在一般推理基准测试中也取得了性能提升。代码和数据集已公开发布于 https://github.com/hewei2001/ReachQA。

关键词

引用

@article{arxiv.2410.18797,
  title  = {Learning Geodesics of Geometric Shape Deformations From Images},
  author = {Nian Wu and Miaomiao Zhang},
  journal= {arXiv preprint arXiv:2410.18797},
  year   = {2025}
}

备注

Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:019