中文

大语言模型能否帮助分配公共卫生资源?关于儿童血铅检测的案例研究

计算机与社会 2026-04-30 v1 人工智能

摘要

公共卫生机构面临着在资源有限的情况下识别儿童血铅暴露高风险社区的关键挑战。为此,我们开发了一种优先级评分,将未测试儿童比例、血铅高浸染率以及公共卫生覆盖模式整合,以支持在芝加哥、纽约市和华盛顿特区136个社区之间进行资源的最优分配。我们利用这些需要整合多种风险指标并解释实证证据的分配任务,评估大语言模型(LLM)在结构化分配情景下,是否能通过具备智能体推理和深度研究能力的LLM有效分配公共卫生资源。LLM被要求在每个城市基于社区风险指标分配1000套检测试剂。结果显示出显著的局限性:LLM经常忽略血铅最高浓度和未测试儿童比例最大的社区(如芝加哥的西恩格尔伍德),同时在纽约市的亨茨斯滕特等低优先级地区分配不比。总体准确率平均为0.46,在ChatGPT 5 Deep Research中达到最高的0.66。尽管其宣称的深度研究能力,LLM在信息检索和证据驱动推理方面仍面临根本性局限,经常引用过时数据,允许非经验性叙述覆盖量化风险指标。

关键词

引用

@article{arxiv.2511.18239,
  title  = {Can LLMs Help Allocate Public Health Resources? A Case Study on Childhood Lead Testing},
  author = {Mohamed Afane and Ying Wang and Juntao Chen},
  journal= {arXiv preprint arXiv:2511.18239},
  year   = {2026}
}