TechING:基于 VLM 迈向真实世界技术图像理解
计算与语言
2026-01-27 v1 计算机视觉与模式识别
机器学习
摘要
技术领域的专业人员在讨论过程中通常会手绘(在白板、纸张等上)技术图表(例如流程图、框图等);然而,如果他们后续想要编辑这些图表,则需要从头开始绘制。现代 VLM 在图像理解方面取得了巨大进步,但在理解技术图表时仍存在困难。克服此问题的一种方法是在真实世界的手绘图像上进行微调,但在实践中无法生成大量此类图像。在本文中,我们引入了一个大型合成生成语料库(反映真实世界图像)用于训练 VLM,随后在较小的手绘图像语料库上(借助人类帮助)评估 VLM。我们引入了若干新的自监督任务进行训练,使用各种基线模型进行了广泛实验,并在这些任务上对合成图像微调了 Llama 3.2 11B-instruct 模型,获得了 LLama-VL-TUG,该模型将 Llama 3.2 11B-instruct 的 ROUGE-L 性能显著提升了 2.14 倍,并在所有基线模型中取得了最佳的综合性能。在真实世界图像上,人工评估表明,在 8 种图表类型中的 7 种里,我们在所有基线中实现了最少的编译错误,并将 Llama 3.2 11B-instruct 的平均 F1 分数提高了 6.97 倍。
引用
@article{arxiv.2601.18238,
title = {TechING: Towards Real World Technical Image Understanding via VLMs},
author = {Tafazzul Nadeem and Bhavik Shangari and Manish Rai and Gagan Raj Gupta and Ashutosh Modi},
journal= {arXiv preprint arXiv:2601.18238},
year = {2026}
}
备注
Accepted at Findings of EACL 2026, 30 Pages (9 Pages main paper + 4 pages references + 17 pages appendix)