中文

PubMedCausal:面向医学文本因果关系抽取的片段级标注语料库

计算与语言 2026-05-28 v1

摘要

因果关系抽取(CRE)是医学文本挖掘的核心任务,但当前资源常将因果关系与更广泛的关联混为一谈,限制标注仅限于句子层面,或主要聚焦于显式的因果线索。这限制了其对模型能否恢复医学文本中实际表达的因果主张进行评估的实用性。我们引入 PubMedCausal,一个来自 PubMed 摘要的医学 CRE 片段级标注语料库。该语料库包含 30,000 行段落级数据,包括 3,945 条因果关系和 6,491 条经仲裁的因果-因果对。每个因果关系均标注了完整的因果和效应片段、因果类型以及句子级因果性,支持因果检测和完整片段因果抽取的评估。我们对判别式编码器和开源生成模型在检测和抽取设置下进行基准测试。对于因果检测,医学编码器表现最佳,PubMedBERT 达到 F1_1 为 0.7391。对于片段级抽取,最佳生成基准是 DeepSeek-R1-32B,通过 few-shot 提示达到 Cosine 配对 F1_1 为 0.6765。我们进一步测试了在外部因果关系数据集上进行迁移学习的结果,表明该资源支持跨数据集评估。我们的结果表明,医学 CRE 在类别不平衡、长范围因果跨度、隐式因果、跨句关系以及提示敏感性等方面仍然具有挑战性。代码和数据可在此处找到:https://github.com/josiahpaul07/PubMedCausal_Exp

关键词

引用

@article{arxiv.2605.28363,
  title  = {PubMedCausal: A Span-Level Annotated Corpus for Causal Relation Extraction in Biomedical Text},
  author = {Ifeoluwa Kunle-John and Josiah Paul and Oluwatosin Agbaakin and Peter Aina and Ikenna Odezuligbo and Sydney Anuyah},
  journal= {arXiv preprint arXiv:2605.28363},
  year   = {2026}
}

备注

Submitted to EMNLP 2026, 8 Pages, 23 page appendix