中文

微调大型语言模型(LLM)人工智能聊天机器人在眼科中的应用及基于GPT-4的LLM评估

人工智能 2024-02-16 v1

摘要

目的:评估基于GPT-4的评估与人类临床专家在评估由微调后的LLM聊天机器人生成的眼科相关患者查询回答方面的一致性。方法:由眼科医生创建400个眼科问题及配对答案,代表常见的患者问题,分为微调集(368个,92%)和测试集(40个,8%)。我们微调了5个不同的LLM,包括LLAMA2-7b、LLAMA2-7b-Chat、LLAMA2-13b和LLAMA2-13b-Chat。对于测试数据集,额外包含了8个青光眼问答对。由5个微调后的LLM生成200个测试数据集的回答用于评估。使用定制的临床评估标准指导GPT-4评估,基于临床准确性、相关性、患者安全性和易于理解。然后将GPT-4评估与5位临床医生的排名进行比较,以评估临床一致性。结果:在所有微调后的LLM中,基于GPT-4评估,GPT-3.5得分最高(87.1%),其次是LLAMA2-13b(80.9%)、LLAMA2-13b-chat(75.5%)、LLAMA2-7b-Chat(70%)和LLAMA2-7b(68.8%)。GPT-4评估与人类临床医生排名显示出显著一致性,Spearman和Kendall Tau相关系数分别为0.90和0.80;而基于Cohen Kappa的相关性较为适中,为0.50。值得注意的是,定性分析和青光眼子分析揭示了LLM生成回答中的临床不准确性,这些被GPT-4评估适当识别。结论:GPT-4评估的显著临床一致性凸显了其简化LLM聊天机器人对医疗相关查询回答的临床评估的潜力。通过补充现有的依赖临床医生的人工评分,这种高效自动化的评估可以协助未来LLM在医疗领域应用发展的验证。

关键词

引用

@article{arxiv.2402.10083,
  title  = {Fine-tuning Large Language Model (LLM) Artificial Intelligence Chatbots in Ophthalmology and LLM-based evaluation using GPT-4},
  author = {Ting Fang Tan and Kabilan Elangovan and Liyuan Jin and Yao Jie and Li Yong and Joshua Lim and Stanley Poh and Wei Yan Ng and Daniel Lim and Yuhe Ke and Nan Liu and Daniel Shu Wei Ting},
  journal= {arXiv preprint arXiv:2402.10083},
  year   = {2024}
}

备注

13 Pages, 1 Figure, 8 Tables