用于文档级关系抽取的 None 类排序损失
计算与语言
2022-05-04 v2 机器学习
摘要
文档级关系抽取(RE)旨在抽取跨多个句子表达的实体间关系,可视为多标签分类问题。在典型文档中,大多数实体对不表达任何预定义关系,被标注为“none”或“无关系”。为获得良好的文档级 RE 性能,区分此类 none 类实例(实体对)与预定义类(关系)实例至关重要。然而,多数现有方法仅独立估计预定义关系的概率,而未考虑“无关系”的概率。这忽略了实体对的上下文以及 none 类与预定义类间的标签关联,导致次优预测。为解决该问题,我们提出一种新的多标签损失,鼓励每个预定义类与 none 类间标签置信度得分的大间隔,从而实现捕获的标签关联与依赖于上下文的标签预测阈值化。为进一步提升对真实世界 RE 数据集中可能出现的正负不平衡与错误标注数据的鲁棒性,我们提出间隔正则化与间隔偏移技术。实验结果表明,我们的方法显著优于现有文档级 RE 多标签损失,且在其他如情感分类等存在 none 类实例可用于训练的多标签任务中亦表现良好。
引用
@article{arxiv.2205.00476,
title = {None Class Ranking Loss for Document-Level Relation Extraction},
author = {Yang Zhou and Wee Sun Lee},
journal= {arXiv preprint arXiv:2205.00476},
year = {2022}
}
备注
Accepted by IJCAI 2022. Code available at https://github.com/yangzhou12/NCRL