为学习型医疗信息物理系统整理自然对抗数据集
机器学习
2023-11-08 v2 人工智能
摘要
深度学习模型在时序医疗应用中已展现出有前景的预测精度。然而,确保这些模型的鲁棒性对于构建可信赖的 AI 系统至关重要。现有研究主要关注对合成对抗样本的鲁棒性,这些样本通过对干净输入数据添加难以察觉的扰动而构造。然而,这些合成对抗样本并不能准确反映最具挑战性的真实场景,尤其在医疗数据背景下。因此,对合成对抗样本的鲁棒性未必能转化为对自然发生的对抗样本的鲁棒性,而后者对于可信赖 AI 极为重要。我们提出一种方法来整理由自然对抗样本组成的数据集以评估模型鲁棒性。该方法依赖于由自动化弱监督标注获得的 probabilistic labels(概率标签),其结合了有噪声且获取成本低廉的标注启发式规则。基于这些标签,我们的方法对输入数据进行对抗性排序,并利用该排序构建一系列逐渐增强对抗性的数据集。我们在六个医疗案例研究和三个非医疗案例研究上的评估证明了我们生成自然对抗数据集方法的有效性与统计有效性。
引用
@article{arxiv.2309.00543,
title = {Curating Naturally Adversarial Datasets for Learning-Enabled Medical Cyber-Physical Systems},
author = {Sydney Pugh and Ivan Ruchkin and Insup Lee and James Weimer},
journal= {arXiv preprint arXiv:2309.00543},
year = {2023}
}