针对人类专业知识的审计
机器学习
2024-11-26 v3 计算机与社会
机器学习
摘要
高风险预测任务(如患者诊断)通常由训练有素的人类专家处理。此类场景中自动化的一大担忧来源是,专家可能运用难以建模的直觉,和/或能获取(如与患者交谈)某个拟设算法根本无法获得的信息。这引出一个自然问题:人类专家是否增添了任何算法预测器都无法捕获的价值?我们开发了一个统计框架,可将该问题表述为一个自然的假设检验。事实上,正如我们的框架所强调的,检测人类专业知识比简单比较专家预测与某特定学习算法预测的准确率更微妙。相反,我们提出一个简单流程,检验在给定可用输入(‘特征’)条件下,专家预测是否与关注的结果统计独立。因此,拒绝我们的检验意味着人类专家可能为任何基于可用数据训练的算法增添价值,并对给定预测任务中人机‘互补性’是否可实现具有直接含义。我们利用从某大型学术医院系统急诊科收集的入院数据展示该流程的效用,表明医师对急性胃肠道出血(AGIB)患者的收治/出院决策似乎纳入了标准算法筛查工具无法获得的信息。尽管该筛查工具可以说比医师的自由裁量决策更准确,这凸显出——即便撇开关于问责或可解释性的规范性担忧——准确率不足以证明算法自动化合理。
引用
@article{arxiv.2306.01646,
title = {Auditing for Human Expertise},
author = {Rohan Alur and Loren Laine and Darrick K. Li and Manish Raghavan and Devavrat Shah and Dennis Shung},
journal= {arXiv preprint arXiv:2306.01646},
year = {2024}
}
备注
30 pages, 10 figures. Appeared in the proceedings of the 37th Conference on Neural Information Processing Systems (NeurIPS 2023). 11/2024 replacement fixes typo in the definition of $\tau_k$, as pointed out by Liuquan Nie