NegBERT:一种用于否定检测与否定范围解析的迁移学习方法
计算与语言
2020-05-26 v4
摘要
否定是语言的一个重要特征,也是从文本中进行信息抽取的主要组成部分。该子任务对生物医学领域具有重要意义。多年来,人们探索了多种方法来解决这一问题:基于规则的系统、机器学习分类器、条件随机场模型、CNN 以及近期的 BiLSTM。在本文中,我们研究将迁移学习应用于该问题。首先,我们广泛回顾了以往针对否定检测与否定范围解析的文献,涉及三个多年来广受欢迎的数据集:BioScope 语料库、Sherlock 数据集和 SFU 评论语料库。随后,我们探讨了使用流行的迁移学习模型 BERT 完成该任务时的决策选择,并报告了在全部三个数据集上否定范围解析的当前最优结果。我们的模型称为 NegBERT,在 Sherlock 数据集上取得 92.36 的 token 级 F1 分数,在 BioScope 摘要子语料库上为 95.68,在 BioScope 全文子语料库上为 91.24,在 SFU 评论语料库上为 90.95,显著优于以往的 SOTA 系统。我们还分析了模型对其未训练数据集的泛化能力。
引用
@article{arxiv.1911.04211,
title = {NegBERT: A Transfer Learning Approach for Negation Detection and Scope Resolution},
author = {Aditya Khandelwal and Suraj Sawant},
journal= {arXiv preprint arXiv:1911.04211},
year = {2020}
}
备注
The 12th Language Resources and Evaluation Conference (LREC 2020)