中文

CalibreNet:面向多语言序列标注的校准网络

计算与语言 2020-11-12 v1 机器学习

摘要

低资源语言中训练数据的缺乏给命名实体识别(NER)和机器阅读理解(MRC)等序列标注任务带来了巨大挑战。一个主要障碍是预测答案边界上的错误。为解决这个问题,我们提出 CalibreNet,它分两步预测答案。第一步,可采用任何现有的序列标注方法作为基模型来生成初始答案。第二步,CalibreNet 对初始答案的边界进行细化。为应对低资源语言训练数据缺乏的挑战,我们专门开发了一种新颖的无监督短语边界恢复预训练任务,以增强 CalibreNet 的多语言边界检测能力。在两个跨语言基准数据集上的实验表明,所提方法在零样本跨语言 NER 和 MRC 任务上取得了 SOTA 结果。

关键词

引用

@article{arxiv.2011.05723,
  title  = {CalibreNet: Calibration Networks for Multilingual Sequence Labeling},
  author = {Shining Liang and Linjun Shou and Jian Pei and Ming Gong and Wanli Zuo and Daxin Jiang},
  journal= {arXiv preprint arXiv:2011.05723},
  year   = {2020}
}

备注

Long paper in WSDM 2021