生成模型、人类、预测模型:谁在高风险决策中表现更差?
人工智能
2025-02-17 v2 机器学习
摘要
尽管有强烈建议反对,大型生成模型(LMs)已被用于执行以前由预测模型或人类完成的决策任务。我们在一个高风险决策任务——累犯预测中,对流行的LM进行了测试。我们研究了三个闭源和开源LM,不仅从准确性角度,还从与(不完美的、有噪声的、有时有偏见的)人类预测或现有预测模型的一致性角度进行分析。我们进行了实验,研究提供不同类型信息(包括照片等干扰信息)如何影响LM的决策。我们还对旨在提高LM准确性或减轻偏见的技巧进行了压力测试,并发现其中一些技巧会产生意想不到的后果。我们的结果为“当前LM不适合这类任务”的观点提供了额外的定量证据。
关键词
引用
@article{arxiv.2410.15471,
title = {Generative Models, Humans, Predictive Models: Who Is Worse at High-Stakes Decision Making?},
author = {Keri Mallari and Julius Adebayo and Kori Inkpen and Martin T. Wells and Albert Gordo and Sarah Tan},
journal= {arXiv preprint arXiv:2410.15471},
year = {2025}
}