中文

利用合成数据实现结构化视觉内容的自动解析

计算机视觉与模式识别 2022-05-02 v1

摘要

结构化视觉内容(SVC),如图形、流程图等,被作者用来阐释各种概念。尽管此类图像有助于普通读者更好地理解内容,但包含 SVC 的图像通常不可被机器读取。这进而不仅阻碍了自动化知识聚合,也影响了视障人士对所呈现信息的感知。在本工作中,我们提出了一个合成数据集,包含以图像形式呈现的 SVC 及其真值标注。我们展示了一个应用如何使用该数据集,从 SVC 图像中自动提取图表示,这是通过常见监督学习方法训练模型来实现的。由于目前尚不存在用于 SVC 详细分析的大规模公共数据集,我们提出了 Synthetic SVC(SSVC)数据集,包含 12,000 张图像及相应的边界框标注和详细图表示。我们的数据集能够在跳过耗时的密集数据标注的同时,支持开发用于解释 SVC 的强大模型。我们在合成数据和人工标注数据上评估了我们的模型,并通过所提出应用下的多种指标展示了从合成到真实的迁移能力。在此,我们评估表明这一概念验证在某种程度上是可行的,并为该任务奠定了坚实的基线。我们讨论了该方法进一步改进的局限性。我们所采用的指标可作为该领域未来比较的工具。为推动该任务的进一步研究,数据集公开于 https://bit.ly/3jN1pJJ。

关键词

引用

@article{arxiv.2204.14136,
  title  = {Towards Automatic Parsing of Structured Visual Content through the Use of Synthetic Data},
  author = {Lukas Scholch and Jonas Steinhauser and Maximilian Beichter and Constantin Seibold and Kailun Yang and Merlin Knäble and Thorsten Schwarz and Alexander Mädche and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2204.14136},
  year   = {2022}
}

备注

7 pages