ACL-Fig:一个用于科学图表分类的数据集
人工智能
2023-01-31 v1 计算机视觉与模式识别
数字图书馆
摘要
大多数现有的大规模学术搜索引擎都是为检索基于文本的信息而构建的。然而,目前还没有针对科学图表和表格的大规模检索服务。此类服务面临的一个挑战是理解科学图表的语义,例如其类型和用途。一个关键障碍是缺乏包含标注科学图表和表格的数据集,而这些数据集可用于分类、问答和自动配图说明。在此,我们开发了一条从科学文献中提取图表和表格的流程,以及一个基于深度学习的框架,利用视觉特征对科学图表进行分类。利用该流程,我们构建了首个大规模自动标注语料库 ACL-Fig,包含从 ACL Anthology 中约 56K 篇研究论文提取的 112,052 张科学图表。ACL-Fig-Pilot 数据集包含 1,671 张手动标注的科学图表,属于 19 个类别。该数据集可在 https://huggingface.co/datasets/citeseerx/ACL-fig 获取,采用 CC BY-NC 许可。
引用
@article{arxiv.2301.12293,
title = {ACL-Fig: A Dataset for Scientific Figure Classification},
author = {Zeba Karishma and Shaurya Rohatgi and Kavya Shrinivas Puranik and Jian Wu and C. Lee Giles},
journal= {arXiv preprint arXiv:2301.12293},
year = {2023}
}
备注
6 pages, 4 figures, accepted by the AAAI-23 Workshop on Scientific Document Understanding