BBAEG:面向文本分类的基于 BERT 的生物医学对抗样本生成
计算与语言
2021-04-06 v1
摘要
医疗健康预测分析辅助医疗决策、诊断预测与药物评论分析。因此,预测精度是一项重要准则,这也要求具备鲁棒的预测语言模型。然而,使用深度学习的模型已被证明对微小扰动的输入实例脆弱,这类实例不太可能被人类误分类。近期在通用领域已出现基于规则同义词和 BERT-MLM 生成对抗样本的尝试,但日益增长的生物医学文献带来了独特挑战。我们提出 BBAEG(基于生物医学 BERT 的对抗样本生成),一种用于生物医学文本分类的黑盒攻击算法,结合了面向生物医学命名实体的领域特定同义词替换与 BERTMLM 预测、拼写变体及数字替换的优势。通过在两个数据集上的自动与人工评估,我们表明相较于先前工作,BBAEG 以更好的语言流畅度与语义连贯性实现了更强的攻击。
引用
@article{arxiv.2104.01782,
title = {BBAEG: Towards BERT-based Biomedical Adversarial Example Generation for Text Classification},
author = {Ishani Mondal},
journal= {arXiv preprint arXiv:2104.01782},
year = {2021}
}
备注
To appear in NAACL 2021