中文

基于 Span 与交互式融合表示的中文医学文本联合实体-关系抽取模型

计算与语言 2025-02-14 v1 人工智能

摘要

联合实体-关系抽取是将非结构化或半结构化文本转化为三元组的关键任务,这有助于构建大规模知识图谱并支持 various 下游应用。尽管如此重要,针对中文文本,尤其是医学等专业领域中复杂语义的研究仍有限。为填补这一空白,本文引入 CH-DDI,一个中文药物-药物相互作用数据集,旨在捕捉医学文本的细微差别。利用注意力机制捕获长程依赖的优势,我们提出 SEA 模块,增强对复杂上下文语义信息的抽取,从而提高实体识别和关系抽取效果。此外,为解决现有方法在实体识别与关系抽取之间信息交换效率不足的问题,我们提出交互式融合表示模块。该模块采用 Cross Attention 实现任务之间的双向信息交换,并通过 BiLSTM 进一步细化特征提取。在我们构建的 CH-DDI 数据集和公开 CoNLL04 数据集上的实验结果表明,该模型具有强大的泛化能力。在 CH-DDI 数据集上,实体识别的 F1 分数达到 96.73%,关系抽取达到 78.43%。在 CoNLL04 数据集上,实体识别精确率达到 89.54%,关系抽取准确率达到 71.64%。

关键词

引用

@article{arxiv.2502.09247,
  title  = {The Joint Entity-Relation Extraction Model Based on Span and Interactive Fusion Representation for Chinese Medical Texts with Complex Semantics},
  author = {Danni Feng and Runzhi Li and Jing Wang and Siyu Yan and Lihong Ma and Yunli Xing},
  journal= {arXiv preprint arXiv:2502.09247},
  year   = {2025}
}