中文

用于临床摘要事实对齐的合成模仿编辑反馈

计算与语言 2023-11-06 v2 人工智能

摘要

GPT 和 LLaMA 系列等大型语言模型(LLMs)在捕捉和浓缩关键上下文信息方面展现出卓越能力,并在摘要任务中取得最先进的性能。然而,社区对这些模型幻觉问题的担忧持续上升。LLMs 有时会生成事实性幻觉摘要,这在临床领域 NLP 任务(例如临床笔记摘要)中可能极具危害,因为事实错误的陈述可导致严重错误的诊断。使用人类反馈微调 LLMs 已显示出使 LLMs 在生成时保持事实一致性的潜力,但此类训练过程需要高质量的人类标注数据,在临床领域获取成本极高。在本工作中,我们提出一种新流程,使用 ChatGPT 替代人类专家生成高质量反馈数据,以提升临床笔记摘要任务中的事实一致性。我们特别关注编辑反馈,因为近期工作讨论了在复杂情境(如需要大量专家知识的临床 NLP 任务)中通过偏好反馈进行人类对齐的不足,以及从领域专家处收集编辑反馈的一些优势。此外,尽管 GPT 已在许多临床 NLP 任务(如 USMLE 问答)中达到专家水平,此前鲜有工作探讨 GPT 能否在临床笔记摘要任务中为语言模型生成专家级编辑反馈。我们希望填补这一空白。最后,我们的评估展示了 GPT 编辑在人类对齐中的潜在用途,尤其从事实性角度。

关键词

引用

@article{arxiv.2310.20033,
  title  = {Synthetic Imitation Edit Feedback for Factual Alignment in Clinical Summarization},
  author = {Prakamya Mishra and Zonghai Yao and Shuwei Chen and Beining Wang and Rohan Mittal and Hong Yu},
  journal= {arXiv preprint arXiv:2310.20033},
  year   = {2023}
}

备注

To appear in NeurIPS 2023 Workshop SyntheticData4ML