AceParse:面向学术文献解析的多样化结构化文本综合数据集
计算与语言
2025-02-04 v2 人工智能
摘要
随着以数据为中心的AI的发展,焦点已从模型驱动的方法转向提高数据质量。学术文献作为关键类型之一,主要以PDF格式存储,在进一步处理之前需要解析为文本。然而,由于缺乏涵盖各种文本结构的数据集,解析学术文献中多样化的结构化文本仍然具有挑战性。在本文中,我们介绍了AceParse,这是第一个旨在支持解析广泛结构化文本的综合数据集,包括公式、表格、列表、算法以及嵌入数学表达式的句子。基于AceParse,我们微调了一个名为AceParser的多模态模型,该模型能准确解析学术文献中的各种结构化文本。该模型在F1分数上比先前的最先进模型高出4.1%,在Jaccard相似度上高出5%,展示了多模态模型在学术文献解析中的潜力。我们的数据集可在https://github.com/JHW5981/AceParse获取。
引用
@article{arxiv.2409.10016,
title = {AceParse: A Comprehensive Dataset with Diverse Structured Texts for Academic Literature Parsing},
author = {Huawei Ji and Cheng Deng and Bo Xue and Zhouyang Jin and Jiaxin Ding and Xiaoying Gan and Luoyi Fu and Xinbing Wang and Chenghu Zhou},
journal= {arXiv preprint arXiv:2409.10016},
year = {2025}
}
备注
5 pages, 3 figures, 3 tables