中文

电信领域视觉理解度量:基于VLMs的图像到UML转换性能指标

机器学习 2025-09-16 v1 计算与语言

摘要

电信领域的3GPP文档充斥着包含序列图的图像。视觉语言大模型的发展简化了此类图像向机器可读的PlantUML格式的转换。然而,在此类转换的评估方面存在一个空白——现有工作不会比较各组件的puml脚本。在本工作中,我们提出了用于衡量此类转换有效性的性能指标。选择了一个来自3GPP文档的序列图数据集,以代表领域特定的实际场景。我们将两个VLMs——Claude Sonnet和GPT-4V——的puml输出与手动创建的真实表示进行了比较。我们使用版本控制工具来捕获差异,并引入了标准性能指标来沿各组件衡量准确性:参与者识别、消息流准确性、序列排序和分组结构保持。我们证明了所提出的指标在量化puml脚本各组件转换错误方面的有效性。结果表明节点、边和消息被准确捕获。然而,我们观察到VLMs在笔记、框、组等复杂结构上不一定表现良好。我们的实验和性能指标表明需要在训练数据中更好地表示这些组件以进行微调VLMs。

关键词

引用

@article{arxiv.2509.11667,
  title  = {Measuring Visual Understanding in Telecom domain: Performance Metrics for Image-to-UML conversion using VLMs},
  author = {HG Ranjani and Rutuja Prabhudesai},
  journal= {arXiv preprint arXiv:2509.11667},
  year   = {2025}
}