进入单细胞多宇宙:面向生物医学文本中程序性知识抽取的端到端数据集
计算与语言
2023-09-06 v1
摘要
许多最常探索的自然语言处理(NLP)信息抽取任务可被视为陈述性知识或基于事实的信息抽取的评估。程序性知识抽取,即将所描述的过程分解为一系列步骤,受到的关注少得多,部分原因或许在于缺乏从端到端捕获知识抽取过程的结构化数据集。为满足这一未竟需求,我们提出FlaMBé(Flow annotations for Multiverse Biological entities),一组跨系列互补任务、由专家标注的数据集,捕获生物医学文本中的程序性知识。该数据集的灵感源于如下观察:作为非结构化文本描述的程序性知识的一个普遍来源,存在于学术论文对其方法的描述中。FlaMBé中标注的工作流来自单细胞研究这一新兴领域的文本,该研究领域因其所用软件工具数量之多与工作流之复杂而声名狼藉。此外,据我们所知,FlaMBé提供了最大的手动标注的组织/细胞类型命名实体识别(NER)与消歧(NED)数据集,这是一种对生物医学研究领域知识抽取至关重要的基础生物实体。除了提供有价值的数据集以推动程序性知识抽取的NLP模型进一步发展外,工作流挖掘过程的自动化对推进生物医学研究中的可重复性也具有重要意义。
引用
@article{arxiv.2309.01812,
title = {Into the Single Cell Multiverse: an End-to-End Dataset for Procedural Knowledge Extraction in Biomedical Texts},
author = {Ruth Dannenfelser and Jeffrey Zhong and Ran Zhang and Vicky Yao},
journal= {arXiv preprint arXiv:2309.01812},
year = {2023}
}
备注
Submitted to NeurIPS 2023 Datasets and Benchmarks Track