中文

深度学习模型对临床文本中的噪声不具备鲁棒性

计算与语言 2021-08-30 v1 人工智能

摘要

人工智能(AI)系统因能够学习需要人类智能与专家知识的复杂任务,在医学领域正吸引越来越多的关注。采用高性能自然语言处理(NLP)模型的AI系统已在多种临床文本处理基准上取得最先进结果,甚至在部分任务上超越人类准确率。然而,此类AI系统的性能评估仅限于在精心整理且干净的基准数据集上的准确率度量,可能无法恰当反映这些系统在真实场景中稳健运行的能力。为应对该挑战,我们引入并实现了多种扰动方法,以模拟临床文本数据中不同类型的噪声与变异。尽管这些扰动方法产生的含噪样本常可被人类理解,却可能导致AI系统做出错误决策。我们在若干临床文本处理任务上开展广泛实验,评估高性能NLP模型对各类字符级与词级噪声的鲁棒性。结果显示,当输入含有少量噪声时,NLP模型性能即下降。本研究是揭示临床文本处理系统中AI模型脆弱性的重要一步。所提扰动方法可用于性能评估测试,以考量临床NLP模型在真实场景含噪数据上的稳健运行能力。

关键词

引用

@article{arxiv.2108.12242,
  title  = {Deep learning models are not robust against noise in clinical text},
  author = {Milad Moradi and Kathrin Blagec and Matthias Samwald},
  journal= {arXiv preprint arXiv:2108.12242},
  year   = {2021}
}