中文

联邦设定下的远程监督关系抽取

计算与语言 2020-08-13 v1 机器学习

摘要

本文研究联邦设定下的远程监督关系抽取。以往研究集中于集中式训练假设下的远程监督,需要将来自不同平台的文本收集并存储于一台机器上。然而,集中式训练面临数据壁垒与隐私保护两方面问题,使得将多平台数据集中起来几乎不可能或成本过高。因此,值得在联邦学习范式下研究远程监督,该范式将模型训练与直接访问原始数据的需求解耦。然而,由于包含同一实体对的句子可能分散于不同平台,在联邦设定下克服远程监督的标签噪声变得更为困难。本文提出一种联邦去噪框架以抑制联邦设定下的标签噪声。该框架的核心是一种基于多实例学习的去噪方法,能够通过跨平台协作筛选可靠实例。在 New York Times 数据集和 miRNA 基因调控关系数据集上的多种实验结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2008.05049,
  title  = {Distantly Supervised Relation Extraction in Federated Settings},
  author = {Dianbo Sui and Yubo Chen and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2008.05049},
  year   = {2020}
}