大语言模型在热带与传染病分类中的上下文评估
计算与语言
2025-01-17 v3 人工智能
摘要
尽管大语言模型(LLM)在医学问答方面展现出潜力,但专注于热带和传染病特定领域探索的工作仍然有限。我们基于一个开源的热带和传染病(TRINDs)数据集,通过加入人口统计学及语义层面的临床和消费者增强,将其扩展至包含超过11000条提示。我们评估了LLM在这些提示上的表现,比较了通用LLM和医学LLM,并将LLM的结果与人类专家进行了对比。我们通过系统性实验证明了上下文信息(如人口统计信息、地点、性别、风险因素)对于获得最佳LLM响应的益处。最后,我们开发了一个名为TRINDs-LM的研究工具原型,该工具提供了一个探索环境,用于导航上下文如何影响LLM在健康领域的输出。
引用
@article{arxiv.2409.09201,
title = {Contextual Evaluation of Large Language Models for Classifying Tropical and Infectious Diseases},
author = {Mercy Asiedu and Nenad Tomasev and Chintan Ghate and Tiya Tiyasirichokchai and Awa Dieng and Oluwatosin Akande and Geoffrey Siwo and Steve Adudans and Sylvanus Aitkins and Odianosen Ehiakhamen and Eric Ndombi and Katherine Heller},
journal= {arXiv preprint arXiv:2409.09201},
year = {2025}
}
备注
Accepted at 2 NeurIPS 2024 workshops: Generative AI for Health Workshop and Workshop on Advancements In Medical Foundation Models: Explainability, Robustness, Security, and Beyond