医学中的大语言模型精调:直接偏好优化的作用与重要性
计算与语言
2024-12-16 v3 人工智能
摘要
大型语言模型(LLM)在医学领域的精调仍被低估使用。两种最常见的精调方法是监督式精调(SFT)和直接偏好优化(DPO),但缺乏关于何时使用哪种技术的指导。在本次调查中,我们比较了 SFT 和 DPO 在医学中五种常见自然语言任务中的性能:基于文本数据的分类、基于数值数据的分类、临床推理、摘要生成和临床分流。我们发现,仅使用 SFT 对基于文本数据的分类就足够了,而 DPO 可提升更复杂任务(如临床推理、摘要生成和临床分流)的性能。我们的结果确立了 DPO 精调在医学中的作用与重要性,从而引发对阻碍其广泛部署的当前软件缺口的关注。
引用
@article{arxiv.2409.12741,
title = {Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization},
author = {Thomas Savage and Stephen Ma and Abdessalem Boukil and Vishwesh Patel and Ekanath Rangan and Ivan Lopez and Jonathan H Chen},
journal= {arXiv preprint arXiv:2409.12741},
year = {2024}
}