中文

向语言生成中注入知识:基于医疗对话自动生成就诊后护理指导的案例分析

计算与语言 2023-06-07 v1

摘要

在医疗等高风险领域的自然语言生成实际应用中,事实正确性常常是限制因素。保持事实性的基本要求之一是处理罕见词元的能力。本文关注同时出现在源序列与参考序列中的罕见词元,这类词元若在生成时被遗漏,会降低输出文本的事实正确性。针对同样知识密集的高风险领域,我们展示了如何利用知识来(a)识别源与参考中同时出现的重要罕见词元,以及(b)提升其条件概率。我们引入编码知识并作为正则化项的“利用率”,通过最大化所选词元的边际概率来实现。我们在医疗这一知识密集领域开展研究,解决基于医患对话生成就诊后护理指导的问题。我们验证了,在数据中,具有高利用率的特定医学概念被常规训练的序列到序列模型所低估。我们观察到,用我们的知识注入方法纠正此问题,降低了模型的不确定性,并在不损害流畅性的情况下提升了事实性与连贯性。

关键词

引用

@article{arxiv.2306.03652,
  title  = {Injecting knowledge into language generation: a case study in auto-charting after-visit care instructions from medical dialogue},
  author = {Maksim Eremeev and Ilya Valmianski and Xavier Amatriain and Anitha Kannan},
  journal= {arXiv preprint arXiv:2306.03652},
  year   = {2023}
}

备注

ACL 2023 (main conference)