评估与增强大语言模型在特定领域医学中的表现:基于 DocOA 的骨关节炎管理
计算与语言
2024-01-25 v1 人工智能
摘要
大语言模型(LLMs)在特定领域医学中的效能,尤其是在管理如骨关节炎(OA)等复杂疾病方面,仍有待深入探索。本研究以骨关节炎管理为案例,聚焦于评估和增强 LLMs 在特定领域的临床能力。我们开发了一个特定领域的基准测试框架,该框架在从领域特定知识到真实世界临床场景的临床应用范围内评估 LLMs。我们开发了 DocOA,一个专为 OA 管理定制、集成了检索增强生成(RAG)和指令提示的专用 LLM。研究通过客观和人工评估,比较了 GPT-3.5、GPT-4 和专用助手 DocOA 的性能。结果表明,像 GPT-3.5 和 GPT-4 这样的通用 LLM 在 OA 管理这一特定领域效果欠佳,尤其是在提供个性化治疗建议方面。然而,DocOA 显示出显著的改进。本研究引入了一个新颖的基准框架,用于多维度评估 LLMs 的领域特定能力,揭示了通用 LLMs 在临床环境中的局限性,并展示了定制化方法在开发特定领域医学 LLMs 方面的潜力。
引用
@article{arxiv.2401.12998,
title = {Evaluating and Enhancing Large Language Models Performance in Domain-specific Medicine: Osteoarthritis Management with DocOA},
author = {Xi Chen and MingKe You and Li Wang and WeiZhi Liu and Yu Fu and Jie Xu and Shaoting Zhang and Gang Chen and Kang Li and Jian Li},
journal= {arXiv preprint arXiv:2401.12998},
year = {2024}
}
备注
16 Pages, 7 Figures