中文

DOREMI:优化文档级关系抽取中的长尾预测

计算与语言 2026-01-19 v1

摘要

文档级关系抽取(DocRE)由于依赖跨句子上下文以及关系类型的长尾分布,面临着显著挑战——许多关系类型拥有稀缺的训练样本。本文引入DOcument-level Relation Extraction optiMizing the long taIl(DOREMI),一个迭代框架,通过最小且有针对性的手动标注来增强 underrepresented 关系。不同于依赖大规模噪声数据或启发式去噪的先前方法,DOREMI主动选择最具信息性的样本,以提高训练效率和鲁棒性。DOREMI可以应用于任何现有的DocRE模型,能够有效缓解长尾偏见,提供一种可扩展的解决方案,以提高稀有关系的泛化能力。

关键词

引用

@article{arxiv.2601.11190,
  title  = {DOREMI: Optimizing Long Tail Predictions in Document-Level Relation Extraction},
  author = {Laura Menotti and Stefano Marchesin and Gianmaria Silvello},
  journal= {arXiv preprint arXiv:2601.11190},
  year   = {2026}
}

备注

Accepted for publication in Knowledge-Based Systems