HCRE:基于LLM的层次化跨文档关系抽取——预测后验证策略
计算与语言
2026-04-21 v2
摘要
跨文档关系抽取(RE)旨在识别位于不同文档中的头实体与尾实体之间的关系。现有方法通常采用"小型语言模型(SLM)+分类器"的范式,但SLM的有限语言理解能力限制了其性能进一步提升。本文我们初步探索了大语言模型(LLM)在跨文档RE中的表现。尽管拥有大量参数,LLM的实验结果表明其并不一致地超越现有SLM。进一步分析表明,性能不佳主要归因于大量预定义关系带来的挑战。为克服此问题,我们提出一种基于LLM的跨文档RE层次化分类模型(HCRE),其包含两个核心组件:1)用于关系预测的LLM,以及2)从预定义关系集合中导出的"层次化关系树"。该树使LLM能够进行层次化分类,即逐层推断目标关系。由于子节点数量远小于整个预定义关系集的大小,层次化关系树显著减少了LLM在推理过程中需要考虑的关系选项数量。然而,层次化分类引入了跨层级误差传播的风险。为缓解此问题,我们提出一种"预测后验证"推理策略,通过每层的多视角验证提高预测可靠性。广泛的实验表明,HCRE超越了现有基线,验证了其有效性。
引用
@article{arxiv.2604.07937,
title = {HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy},
author = {Guoqi Ma and Liang Zhang and Hongyao Tu and Hao Fu and Hui Li and Yujie Lin and Longyue Wang and Weihua Luo and Jinsong Su},
journal= {arXiv preprint arXiv:2604.07937},
year = {2026}
}
备注
ACL 2026 Findings; camera ready version