端到端自动去标识化:高准确率是否是唯一指标?
计算机与社会
2020-02-18 v1 机器学习
机器学习
摘要
电子健康记录(EHR)的去标识化是推动健康信息学研究发展并最大化利用可用数据的关键步骤。它是一个两步过程:第一步是识别受保护健康信息(PHI),第二步是用替代值替换此类 PHI。尽管 EHR 自动去标识化近期取得了进展,但若要充分发挥海量健康数据的潜力,仍存在重大障碍。去标识化的准确率可视为在无个体患者同意下使用 EHR 的必要但不充分条件。本文对此前进展进行了全面综述,既包括实现高准确率的显著成果,也包括仍存在的重大风险与挑战。据我们所知,这是首篇呈现端到端自动去标识化全貌的论文。我们回顾了 18 个近期发布的自动去标识化系统——旨在以自由文本形式对 EHR 去标识化——以展示在提升系统整体准确率及识别个体 PHI 方面的进展。我们认为,尽管准确率有所提升,在替代值生成与已识别 PHI 的替换方面仍存在挑战,且对患者保护与隐私构成风险。
引用
@article{arxiv.1901.10583,
title = {Automatic end-to-end De-identification: Is high accuracy the only metric?},
author = {Vithya Yogarajan and Bernhard Pfahringer and Michael Mayo},
journal= {arXiv preprint arXiv:1901.10583},
year = {2020}
}
备注
17 pages, 1 figure, 7 tables, review journal paper