中文

流水线、序列到序列与GPT模型用于端到端关系抽取的对比:以罕见病用例实验

计算与语言 2025-07-28 v3

摘要

端到端关系抽取(E2ERE)是自然语言处理(NLP)在生物医学中的重要且现实的应用。本文旨在利用一个聚焦罕见病、涉及不连续与嵌套实体的复杂数据集,对比三种主流E2ERE范式。我们使用RareDis信息抽取数据集评估三种竞争方法(用于E2ERE):NER→RE流水线、联合序列到序列模型,以及生成式预训练Transformer(GPT)模型。我们对每种方法采用可比的先进模型与最佳实践,并进行错误分析以评估其失效模式。我们的发现揭示流水线模型仍最佳,序列到序列模型紧随其后;参数多八倍的GPT模型甚至逊于序列到序列模型,并以超过10个F1点之差输给流水线模型。部分匹配与不连续实体造成诸多NER错误,导致整体E2E性能下降。我们也在第二个化学-蛋白质相互作用的E2ERE数据集上验证了这些发现。尽管基于生成式语言模型的方法更适于零样本设定,但当训练数据可用时,我们的结果表明最好使用为E2ERE训练并定制的更常规模型。需更具创新的方法结合较小编码器-解码器流水线模型与较大GPT模型两者之长以改进E2ERE。迄今,我们看到设计良好的流水线模型以更低成本与碳足迹提供显著性能增益。我们的贡献也是首次对RareDis数据集开展E2ERE。

关键词

引用

@article{arxiv.2311.13729,
  title  = {Comparison of pipeline, sequence-to-sequence, and GPT models for end-to-end relation extraction: experiments with the rare disease use-case},
  author = {Shashank Gupta and Xuguang Ai and Ramakanth Kavuluru},
  journal= {arXiv preprint arXiv:2311.13729},
  year   = {2025}
}

备注

An updated version of this paper has appeared in the proceedings of NLDB 2025 with a different title. The corresonding DOI is in the metadata provided below