通过在弱标签上微调轻量级 LLM 增强放射学报告中的疾病检测
人工智能
2024-09-26 v1
摘要
尽管在将大语言模型(LLMs)应用于医疗领域方面取得了显著进展,但若干局限性仍阻碍其实际应用。其中包括模型规模的限制以及缺乏特定队列的标注数据集。在本工作中,我们研究了通过使用合成标签的数据集进行微调,来改进轻量级 LLM(如 Llama 3.1-8B)的潜力。通过结合各自的指令数据集,对两个任务进行了联合训练。当任务特定合成标签的质量相对较高时(例如由 GPT-4o 生成),Llama 3.1-8B 在开放式疾病检测任务上取得了令人满意的性能,micro F1 分数为 0.91。相反,当任务相关合成标签的质量相对较低时(例如来自 MIMIC-CXR 数据集),经过校准的微调 Llama 3.1-8B 能够超越其含噪教师标签(micro F1 分数 0.67 对 0.63),这表明该模型具有强大的内在基础能力。这些发现证明了使用合成标签微调 LLMs 的潜力,为未来医疗领域 LLM 专门化的研究提供了一个有前景的方向。
引用
@article{arxiv.2409.16563,
title = {Enhancing disease detection in radiology reports through fine-tuning lightweight LLM on weak labels},
author = {Yishu Wei and Xindi Wang and Hanley Ong and Yiliang Zhou and Adam Flanders and George Shih and Yifan Peng},
journal= {arXiv preprint arXiv:2409.16563},
year = {2024}
}