中文

将策展整合进科学出版以训练AI模型

计算与语言 2024-09-26 v2

摘要

从学术文章中进行高吞吐量的数据提取与结构化标注,对于实现下游机器学习应用和二次分析至关重要。我们已将多模态数据策展嵌入学术出版流程,以标注分段的图面板与图注。自然语言处理(NLP)与原作者的闭环人工反馈相结合,以提高标注准确性。标注包含八类生物实体(小分子、基因产物、亚细胞组分、细胞系、细胞类型、组织、生物体和疾病)以及额外刻画实体在实验设计和方法学中角色的类别。所得数据集SourceData-NLP包含超过620,000个标注的生物医学实体,选自分子与细胞生物学领域3,223篇文章中的18,689幅图。我们通过对命名实体识别、图注分割为其组成面板,以及评估实体是否为受控干预目标或测量对象的新型上下文相关语义任务,评估该数据集训练AI模型的效用。我们还展示了数据集在执行多模态任务(将图分割为面板图像及其对应图注)中的使用。

关键词

引用

@article{arxiv.2310.20440,
  title  = {Integrating curation into scientific publishing to train AI models},
  author = {Jorge Abreu-Vicente and Hannah Sonntag and Thomas Eidens and Cassie S. Mitchell and Thomas Lemberger},
  journal= {arXiv preprint arXiv:2310.20440},
  year   = {2024}
}

备注

Submitted to Journal for revision