中文

SYNFAC-EDIT:用于临床摘要事实对齐的合成模仿编辑反馈

计算与语言 2024-10-04 v4 人工智能

摘要

GPT 和 Llama 等大语言模型(LLM)在摘要任务中取得了显著成就,但在事实准确性方面存在困难,这是临床自然语言处理应用中的一个关键问题,因为错误可能导致严重后果。为应对事实对齐所需专家标注数据成本高且可用性有限的问题,本研究引入了一种创新流程,利用参数量超过 1000 亿的 GPT 变体(如 GPT-3.5 和 GPT-4)充当合成专家,生成高质量的合成反馈,旨在增强临床笔记摘要的事实一致性。我们的研究主要关注由这些合成反馈专家生成的编辑反馈,无需额外的人工标注,从而镜像并优化了医疗专业人员完善 AI 系统输出的实际场景。尽管此类参数量超过 1000 亿的 GPT 变体已被证明在各种临床自然语言处理任务(如医师执照考试)中展现出专业能力,但关于其作为合成反馈专家的能力,以及为改善较弱(参数量<100 亿)LLM(如 GPT-2 (1.5B) 和 Llama 2 (7B))在临床领域的生成质量提供专家级编辑反馈的研究却寥寥无几。因此,在本工作中,我们利用参数量超过 1000 亿的 GPT 变体充当合成反馈专家,提供专家级编辑反馈,用于减少幻觉并使用两种不同的对齐算法(DPO 和 SALT)使较弱的 LLM 与医学事实保持一致,致力于缩小 AI 生成内容与事实准确性之间的差距。这突显了基于 LLM 的合成编辑在增强临床事实对齐方面的巨大潜力。

关键词

引用

@article{arxiv.2402.13919,
  title  = {SYNFAC-EDIT: Synthetic Imitation Edit Feedback for Factual Alignment in Clinical Summarization},
  author = {Prakamya Mishra and Zonghai Yao and Parth Vashisht and Feiyun Ouyang and Beining Wang and Vidhi Dhaval Mody and Hong Yu},
  journal= {arXiv preprint arXiv:2402.13919},
  year   = {2024}
}

备注

Equal contribution for the first two authors; To appear in proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2024