中文

将 ChatGPT 的医疗建议置于(图灵)测试之中

人机交互 2023-01-25 v1

摘要

目的:评估使用 ChatGPT 或类似基于 AI 的聊天机器人进行医患沟通的可行性。参与者:430 名 18 岁及以上的具有美国代表性的研究参与者。所分析的受访者中 53.2% 为女性;他们的平均年龄为 47.1 岁。暴露:从电子健康记录(EHR)中提取十个代表性的非行政性医患互动。患者的问题被放入 ChatGPT 中,要求聊天机器人以与人类提供者回复大致相同的字数作答。在调查中,每个患者的问题后跟随一个由提供者或 ChatGPT 生成的回复。参与者被告知五个回复由提供者生成,五个由聊天机器人生成。参与者被要求并给以经济激励以正确识别回复来源。参与者还被问及他们对聊天机器人在医患沟通中功能的信任度,使用 1-5 的李克特量表。结果:针对不同问题,回复的正确分类率在 49.0% 到 85.7% 之间。平均而言,聊天机器人回复被正确识别的概率为 65.5%,提供者回复被正确区分的概率为 65.1%。平均而言,患者对聊天机器人功能的信任度回复为弱正向(平均李克特得分:3.4),且随着问题中健康相关任务复杂度的增加信任度降低。结论:ChatGPT 对患者问题的回复与提供者回复弱可区分。外行似乎信任使用聊天机器人回答较低风险的健康问题。

关键词

引用

@article{arxiv.2301.10035,
  title  = {Putting ChatGPT's Medical Advice to the (Turing) Test},
  author = {Oded Nov and Nina Singh and Devin Mann},
  journal= {arXiv preprint arXiv:2301.10035},
  year   = {2023}
}