中文

解锁视觉语言模型对 UML 类图的理解

计算机视觉与模式识别 2026-05-13 v1 人工智能

摘要

尽管视觉语言模型(VLMs)在各种用例中取得了巨大进步,但在回答关于图表的问题时,其表现仍落后于照片。虽然在条形图、折线图等图表领域已取得进展,但针对其他类型图表(例如计算机科学领域的图表)的研究仍然很少。我们的工作提出了一个基于 UML 类图的视觉问答基准,该基准既具挑战性又易于管理。我们进一步构建了一个包含 16,000 个图像-问题-答案三元组的大规模训练数据集,并表明基于 LoRA 的微调轻松超越了 Qwen 3.5 27B,后者是近期在许多其他基准测试中表现优异的 VLM。

关键词

引用

@article{arxiv.2605.11634,
  title  = {Unlocking UML Class Diagram Understanding in Vision Language Models},
  author = {Artem Naboichenko and René Peinl},
  journal= {arXiv preprint arXiv:2605.11634},
  year   = {2026}
}