DOREMI:优化文档级关系抽取中的长尾预测
计算与语言
2026-01-19 v1
摘要
文档级关系抽取(DocRE)由于依赖跨句子上下文以及关系类型的长尾分布,面临着显著挑战——许多关系类型拥有稀缺的训练样本。本文引入DOcument-level Relation Extraction optiMizing the long taIl(DOREMI),一个迭代框架,通过最小且有针对性的手动标注来增强 underrepresented 关系。不同于依赖大规模噪声数据或启发式去噪的先前方法,DOREMI主动选择最具信息性的样本,以提高训练效率和鲁棒性。DOREMI可以应用于任何现有的DocRE模型,能够有效缓解长尾偏见,提供一种可扩展的解决方案,以提高稀有关系的泛化能力。
引用
@article{arxiv.2601.11190,
title = {DOREMI: Optimizing Long Tail Predictions in Document-Level Relation Extraction},
author = {Laura Menotti and Stefano Marchesin and Gianmaria Silvello},
journal= {arXiv preprint arXiv:2601.11190},
year = {2026}
}
备注
Accepted for publication in Knowledge-Based Systems