大规模部署LLM驱动的专家在环医疗聊天机器人的经验
人机交互
2024-09-18 v2
摘要
大型语言模型(LLM)在医疗领域被广泛使用,但幻觉、信息不完整和偏见等局限性阻碍了其可靠性。为解决这些问题,研究人员发布了Build Your Own expert Bot(BYOeB)平台,使开发者能够创建集成专家验证的LLM驱动聊天机器人。CataractBot作为其首个实现,为白内障手术问题提供经专家验证的回答。初步评估显示了其潜力;然而,该研究的样本量较小且主要为定性研究。在本研究中,我们对CataractBot进行了为期24周的大规模部署,涉及318名患者和陪护人员,他们发送了1,992条消息,其中91.71%的回答由七位专家验证。对交互日志的分析表明,医疗问题在数量上显著超过后勤问题,幻觉可忽略不计,专家评定84.52%的医疗回答为准确。随着知识库通过专家纠正而扩展,系统性能提升了19.02%,从而减轻了专家的工作量。这些见解为未来LLM驱动的聊天机器人的设计提供了指导。
引用
@article{arxiv.2409.10354,
title = {Learnings from a Large-Scale Deployment of an LLM-Powered Expert-in-the-Loop Healthcare Chatbot},
author = {Bhuvan Sachdeva and Pragnya Ramjee and Geeta Fulari and Kaushik Murali and Mohit Jain},
journal= {arXiv preprint arXiv:2409.10354},
year = {2024}
}
备注
The first two authors contributed equally to this research