中文

使用多模态转换器对科学图表中的文本角色进行分类

计算机视觉与模式识别 2024-02-23 v1 计算与语言 机器学习

摘要

文本角色分类涉及对科学图表中文本元素语义角色的分类。为完成此任务,我们提出对两个预训练的多模态文档布局分析模型进行微调,分别是 LayoutLMv3 和 UDOP,训练在图表数据集上。转换器利用文本、图像和布局三个模态作为输入。我们进一步研究了数据增强和平衡方法是否有助于模型性能。对模型在各种图表数据集上的评估结果表明,LayoutLMv3 在所有实验中均优于 UDOP。LayoutLMv3 在 ICPR22 测试数据集上实现了最高的 82.87 的 F1-macro 分数,超越了 ICPR22 CHART-Infographics 挑战中最佳模型。此外,还对模型在合成噪声数据集 ICPR22-N 上的鲁棒性进行了测试。最后,在三个图表数据集 CHIME-R、DeGruyter 和 EconBiz 上评估了模型的通用性,其中我们为文本角色添加了标签。发现表明,即使在训练数据有限的情况下,借助数据增强和平衡方法,仍可使用转换器。源代码和数据集均已在 GitHub 上公开,链接为 https://github.com/hjkimk/text-role-classification

关键词

引用

@article{arxiv.2402.14579,
  title  = {Text Role Classification in Scientific Charts Using Multimodal Transformers},
  author = {Hye Jin Kim and Nicolas Lell and Ansgar Scherp},
  journal= {arXiv preprint arXiv:2402.14579},
  year   = {2024}
}