中文

M-BRe:利用大型语言模型从未标注文本中发现用于关系抽取的训练样本

计算与语言 2025-09-11 v2

摘要

对于关系抽取(RE),手动标注训练数据的成本可能极其高昂,因为文本中包含目标关系的句子可能非常稀少且难以找到。因此,开发一种能够从未标注文本中自动提取训练实例以训练 RE 模型的高效方法是非常有益的。最近,大型语言模型(LLM)已被应用于各种自然语言处理任务,RE 也受益于其进步。然而,当利用 LLM 进行具有预定义关系类别的 RE 时,出现了两个关键挑战。首先,在多类分类设置中,LLM 通常难以全面捕捉每种关系的语义,导致次优结果。其次,尽管对每种关系单独使用二元分类可以缓解此问题,但它会引入显著的计算开销,导致实际应用中不可接受的时间复杂度。因此,本文提出了一个名为 M-BRe 的框架,用于从未标注文本中提取 RE 的训练样本。它利用三个模块来结合上述两种分类方法的优点:关系分组、关系抽取和标签决策。大量实验证实了其在从未标注文本中发现高质量 RE 训练样本方面的卓越能力。

关键词

引用

@article{arxiv.2509.07730,
  title  = {M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models},
  author = {Zexuan Li and Hongliang Dai and Piji Li},
  journal= {arXiv preprint arXiv:2509.07730},
  year   = {2025}
}

备注

Accepted by EMNLP2025 Main Conference