基于迷惑检测引导的临床摘要偏好优化
计算与语言
2026-05-29 v1 人工智能
摘要
大型语言模型(LLMs)在摘要任务中显示出良好的潜力,但常常会产生迷惑,这些迷惑是不受支持或不正确的陈述,限制了其在专业医疗应用中的可靠性。我们引入 \itermodelfull (\itermodel),一种推理时方法,利用迷惑检测器引导迭代摘要修订,以实现事实性纠正。建立在此基础上,我们提出 \itermodel 用于偏好学习 (\model),将检测器引导的细化轨迹转换为偏好对以进行模型微调。大量实验表明,我们的方法在总结 \MimicIV 中的真实临床笔记时,显著减少了 Llama 和 Gemma 模型的迷惑。例如,\itermodelfull 减少了 Llama-3.1-8B-Instruct 中 24% 的迷惑,\itermodel 减少了 48% 的迷惑。重要的是,两种方法根据人类专家和 LLM-Jury 评估,保持了摘要的流畅性、连贯性和相关性。总之,这些结果表明,检测信息化的细化和偏好学习为改进临床摘要的事实忠实性提供了自动化解决方案。
引用
@article{arxiv.2605.28910,
title = {Hallucination Detection-Guided Preference Optimization for Clinical Summarization},
author = {Shamanth Kuthpadi Seethakantha and Dung Ngoc Thai and Vara Prasad Gudi and Simran Tiwari and Rami Matar and Avijit Mitra and Wenlong Zhao and Wael Salloum and Andrew McCallum},
journal= {arXiv preprint arXiv:2605.28910},
year = {2026}
}