中文

大规模部署LLM驱动的专家在环医疗聊天机器人的经验

人机交互 2024-09-18 v2

摘要

大型语言模型(LLM)在医疗领域被广泛使用,但幻觉、信息不完整和偏见等局限性阻碍了其可靠性。为解决这些问题,研究人员发布了Build Your Own expert Bot(BYOeB)平台,使开发者能够创建集成专家验证的LLM驱动聊天机器人。CataractBot作为其首个实现,为白内障手术问题提供经专家验证的回答。初步评估显示了其潜力;然而,该研究的样本量较小且主要为定性研究。在本研究中,我们对CataractBot进行了为期24周的大规模部署,涉及318名患者和陪护人员,他们发送了1,992条消息,其中91.71%的回答由七位专家验证。对交互日志的分析表明,医疗问题在数量上显著超过后勤问题,幻觉可忽略不计,专家评定84.52%的医疗回答为准确。随着知识库通过专家纠正而扩展,系统性能提升了19.02%,从而减轻了专家的工作量。这些见解为未来LLM驱动的聊天机器人的设计提供了指导。

关键词

引用

@article{arxiv.2409.10354,
  title  = {Learnings from a Large-Scale Deployment of an LLM-Powered Expert-in-the-Loop Healthcare Chatbot},
  author = {Bhuvan Sachdeva and Pragnya Ramjee and Geeta Fulari and Kaushik Murali and Mohit Jain},
  journal= {arXiv preprint arXiv:2409.10354},
  year   = {2024}
}

备注

The first two authors contributed equally to this research