中文

COMM:面向鲁棒文档级关系抽取的集中边际最大化

计算与语言 2025-03-19 v1

摘要

文档级关系抽取(DocRE)是识别和提取跨越文档中多个句子之间实体关系的过程。鉴于其真实的应用场景,DocRE 在近年来受到越来越多的研究关注。以往的研究主要 focus 于开发复杂的编码模型来更好地捕捉实体对之间复杂的模式。虽然这些进展无疑至关重要,但更根本性的挑战在于数据本身。DocRE 的复杂性使得标注过程容易出错,加上正例关系样本的极度稀疏,这由正样本实例有限和正例关系类型的广泛多样性共同驱动。这可能会导致偏差化的优化过程,进一步 complicate 准确关系抽取的任务。鉴于这些挑战,我们开发了一个 robust 框架,称为 \textit{\textbf{COMM}} 来更好地解决 DocRE。\textit{\textbf{COMM}} 通过采用 instance-aware reasoning 方法,动态捕捉文档中实体对的相关信息并提取关系特征。随后,\textit{\textbf{COMM}} 考虑到关系的分布和样本的难易性,动态调整预测 logits 与 decision threshold 之间的边际,我们称为集中边际最大化。如此一来,\textit{\textbf{COMM}} 不仅提高了相关关系特征的抽取,还通过解决数据所特有的挑战来提升 DocRE 性能。广泛的实验和分析表明,\textit{\textbf{COMM}} 具有多样性和有效性,尤其是在训练低质量数据时表现出色(实现了超过 10% 的性能提升)。

关键词

引用

@article{arxiv.2503.13885,
  title  = {COMM:Concentrated Margin Maximization for Robust Document-Level Relation Extraction},
  author = {Zhichao Duan and Tengyu Pan and Zhenyu Li and Xiuxing Li and Jianyong Wang},
  journal= {arXiv preprint arXiv:2503.13885},
  year   = {2025}
}

备注

AAAI 2025 poster