中文

LLM中的临床知识难以转化为人类交互

人机交互 2025-04-29 v1 人工智能 计算与语言

摘要

全球医疗提供者正在探索使用大型语言模型(LLM)为公众提供医疗建议。LLM现在在医学执照考试中几乎取得完美分数,但这并不一定转化为在真实场景中的准确性能力。我们测试了LLM能否帮助受试者在受控研究中识别潜在疾病并选择行动方案(处方)——在十个医学情景中进行测试,受试者为1298名。受试者被随机分配接收来自LLM(GPT-4o、Llama 3、Command R+)或其选择的来源(对照组)的帮助。单独使用LLM时,模型在情景中准确完成任务,正确识别疾病的比例为94.9%,处方比例为56.3%。然而,使用相同LLM的受试者在少于34.5%的情况下识别相关疾病,在少于44.2%的情况下确定处方,两者都不如对照组。我们确定用户交互是LLM用于医疗建议部署的挑战。标准基准测试用于医学知识和模拟患者交互,无法预测我们发现的人类受试者所出现的失败。展望来看,我们建议在部署于医疗保健领域的公共环境之前,对交互能力进行系统的人类用户测试。

关键词

引用

@article{arxiv.2504.18919,
  title  = {Clinical knowledge in LLMs does not translate to human interactions},
  author = {Andrew M. Bean and Rebecca Payne and Guy Parsons and Hannah Rose Kirk and Juan Ciro and Rafael Mosquera and Sara Hincapié Monsalve and Aruna S. Ekanayaka and Lionel Tarassenko and Luc Rocher and Adam Mahdi},
  journal= {arXiv preprint arXiv:2504.18919},
  year   = {2025}
}

备注

52 pages, 4 figures