OLAPH:提升生物医学长文本问答的事实性
计算与语言
2024-10-16 v3 人工智能
摘要
在医学领域,许多场景需要大型语言模型(LLM)的长文本生成能力。具体来说,在回答患者问题时,模型的回答必须传达事实性声明,这凸显了对自动化评估这些声明方法的需求。因此,我们引入了MedLFQA,一个使用与生物医学领域相关的长文本问答数据集重建的基准数据集。我们使用MedLFQA来促进成本效益高的事实性自动评估。我们还提出了OLAPH,一个简单而新颖的框架,它利用成本效益高且多方面的自动评估来构建合成偏好集,并以我们偏好的方式回答问题。我们的框架引导我们逐步训练LLM以减少幻觉并包含关键的医学声明。我们强调,即使在训练中未使用的评估指标上,使用我们的OLAPH框架训练的LLM在事实性方面也表现出显著的性能提升。我们的发现表明,使用我们的OLAPH框架训练的7B LLM可以提供在事实性方面与医学专家答案相当的长答案。我们相信,我们的工作可以为衡量LLM在医学领域的长文本生成能力提供启示。我们的代码和数据集已公开。
引用
@article{arxiv.2405.12701,
title = {OLAPH: Improving Factuality in Biomedical Long-form Question Answering},
author = {Minbyul Jeong and Hyeon Hwang and Chanwoong Yoon and Taewhoo Lee and Jaewoo Kang},
journal= {arXiv preprint arXiv:2405.12701},
year = {2024}
}