中文

结合远端监督模型与上下文学习实现单语言及跨语言关系抽取

计算与语言 2025-10-22 v1

摘要

远端监督关系抽取 (DSRE) 长期以来是 NLP 中的一个持久挑战,要求模型从噪声的袋级标注中学习,同时进行句子级预测。虽然现有最先进 (SoTA) DSRE 模型依赖于任务特定的训练,但其与大语言模型 (LLM) 的上下文学习 (ICL) 集成仍受到不足的关注。一个关键挑战是 LLM 可能由于标注噪声而未能正确学习关系语义。为此,我们提出 HYDRE -- HYbrid Distantly Supervised Relation Extraction 框架。它首先使用训练好的 DSRE 模型识别给定测试句子的前 k 个候选关系,然后使用一种新颖的动态示例检索策略从训练数据中提取可靠的句子级示例,以供 LLM 在提示中使用,以输出最终关系。我们进一步将 HYDRE 扩展到跨语言设置,用于低资源语言的关系抽取。我们在英语以及一个新精选的基准上评估了所有方法,覆盖四种多样化的低资源印度语言——Odia、Santali、Manipuri 和 Tulu。HYDRE 在英语上实现了最高可达 20 点 F1 分数的提升,在印度语言上平均提升约 17 F1 分数。详细的消融实验表明 HYDRE 在 various 提示策略方面都具有显著效益。

关键词

引用

@article{arxiv.2510.18344,
  title  = {Combining Distantly Supervised Models with In Context Learning for Monolingual and Cross-Lingual Relation Extraction},
  author = {Vipul Rathore and Malik Hammad Faisal and Parag Singla and Mausam},
  journal= {arXiv preprint arXiv:2510.18344},
  year   = {2025}
}