AI聊天机器人从患者主诉预测疾病的可靠性如何?
人工智能
2024-05-24 v1 计算与语言
摘要
利用大语言模型(LLM)的人工智能(AI)聊天机器人正在医疗保健领域获得关注,因其自动化患者交互和辅助临床决策的潜力。本研究考察了AI聊天机器人(具体为GPT 4.0、Claude 3 Opus和Gemini Ultra 1.0)在急诊科从患者主诉预测疾病的可靠性。方法包括使用少样本学习技术评估聊天机器人在疾病预测中的有效性。我们还微调了基于Transformer的模型BERT,并将其性能与AI聊天机器人进行比较。结果表明,GPT 4.0在增加少样本数据时达到高准确率,而Gemini Ultra 1.0在较少示例下表现良好,Claude 3 Opus保持稳定性能。然而,BERT的性能低于所有聊天机器人,表明受限于有限的标注数据。尽管聊天机器人的准确率各异,但没有一个足够可靠以用于关键的医疗决策,这强调了严格验证和人工监督的必要性。本研究反映,虽然AI聊天机器人在医疗保健中具有潜力,但它们应补充而非取代人类专业知识,以确保患者安全。需要进一步改进和研究以提高基于AI的医疗应用在疾病预测中的可靠性。
引用
@article{arxiv.2405.13219,
title = {How Reliable AI Chatbots are for Disease Prediction from Patient Complaints?},
author = {Ayesha Siddika Nipu and K M Sajjadul Islam and Praveen Madiraju},
journal= {arXiv preprint arXiv:2405.13219},
year = {2024}
}
备注
24th IEEE International Conference on Information Reuse and Integration (IEEE IRI 2024), San Jose, CA, USA