中文

面向生物医学自然语言处理任务的对抗样本研究

计算与语言 2020-04-24 v1 机器学习

摘要

预训练词嵌入的成功推动了其在生物医学领域任务中的应用。BERT 语言模型在命名实体识别(NER)和语义文本相似度(STS)等任务的标准性能指标上取得了显著成果,为 NLP 领域带来了重大进展。然而,尚不清楚这些系统是否在法律或医疗等关键领域中表现良好。为此,本文针对医学 NER 和 STS 的两个知名数据集提出了一种对抗评估方案。我们提出了两类受人类自然拼写错误和笔误启发的攻击,还提出了另一种利用医学术语同义词的攻击。在这些对抗设置下,模型的准确率显著下降,我们量化了这种性能损失的程度。我们还表明,通过使用对抗样本训练模型,可以显著提升其鲁棒性。希望我们的工作能推动使用对抗样本来评估并开发对医学任务具有更强鲁棒性的模型。

关键词

引用

@article{arxiv.2004.11157,
  title  = {On Adversarial Examples for Biomedical NLP Tasks},
  author = {Vladimir Araujo and Andres Carvallo and Carlos Aspillaga and Denis Parra},
  journal= {arXiv preprint arXiv:2004.11157},
  year   = {2020}
}