生物医学词嵌入的压力测试评估
计算与语言
2021-07-27 v1 人工智能
摘要
预训练词嵌入的成功推动了其在生物医学领域的应用,上下文嵌入在多项生物医学NLP任务中取得显著成果。然而,关于量化其在严峻“压力”场景下行为的研究尚显不足。本工作中,我们借助对抗样本(自动构建的测试,可检验模型鲁棒性)系统评估三种语言模型。我们提出两类聚焦于生物医学命名实体识别(NER)任务的压力场景,一类受拼写错误启发,另一类基于医学术语同义词的使用。在三个基准上的实验表明,原始模型性能大幅下降,同时也揭示了其弱点与优势。最后,我们展示对抗训练使模型鲁棒性提升,某些情况下甚至超越原始性能。
引用
@article{arxiv.2107.11652,
title = {Stress Test Evaluation of Biomedical Word Embeddings},
author = {Vladimir Araujo and Andrés Carvallo and Carlos Aspillaga and Camilo Thorne and Denis Parra},
journal= {arXiv preprint arXiv:2107.11652},
year = {2021}
}
备注
Accepted paper BioNLP2021