中文

面向文档级关系抽取的判别式且语音感知范式DiVA-DocRE

计算与语言 2025-04-09 v2 人工智能 信息检索

摘要

大语言模型(LLM)在文本理解与生成方面的卓越能力已彻底变革了信息抽取(IE)。其中一种进展是文档级关系三元组抽取(DocRTE),这是信息系统中的关键任务,旨在从文档中抽取实体及其语义关系。然而,现有方法主要针对句子级关系三元组抽取(SentRTE),通常仅处理单个句子内的有限关系与三元组事实。此外,一些方法将关系视为嵌入提示模板中的候选选项,导致处理效率低下,难以 optimal地确定三元组中的关系元素。为此,我们引入判别式且语音感知范式DiVA。DiVA仅需两个步骤:执行文档级关系抽取(DocRE),随后基于关系识别主语和宾语实体。无需额外处理,直接输入文档即可获得三元组。这种简化流程更贴近现实场景。我们的创新点在于将DocRE转化为判别式任务,使模型能够关注每个关系,以及往往被忽视的主动语态与被动语态问题。在Re-DocRED和DocRED数据集上的实验表明,我们的方法在DocRTE任务上实现了最新的性能。

关键词

引用

@article{arxiv.2409.13717,
  title  = {DiVA-DocRE: A Discriminative and Voice-Aware Paradigm for Document-Level Relation Extraction},
  author = {Yiheng Wu and Roman Yangarber and Xian Mao},
  journal= {arXiv preprint arXiv:2409.13717},
  year   = {2025}
}

备注

After internal discussions among the co-authors, we have decided to withdraw the manuscript due to a change in research direction and a lack of unanimous agreement to proceed with publication at this time