一种面向医疗对话信息抽取的知识增强两阶段生成框架
计算与语言
2024-02-21 v4
摘要
本文关注医疗对话中的术语-状态对抽取(MD-TSPE),该任务在诊断对话系统与电子病历(EMR)自动记录中至关重要。近年来,MD-TSPE 相关研究日益受到关注,尤其在生成式方法取得显著进展之后。然而,这些生成式方法在单一阶段输出由术语-状态对组成的完整序列,且忽略了对先验知识的融合,而这需要更深层次的理解来建模术语间关系并推断各术语的状态。本文提出一种知识增强两阶段生成框架(KTGF)以应对上述挑战。借助任务特定的提示(prompt),我们采用单一模型以统一的生成形式分两阶段完成 MD-TSPE:先生成所有术语,再生成每个已生成术语的状态。如此,第一阶段仅含术语的序列可更有效地学习术语间关系,而我们在第二阶段设计的知识增强提示可利用已生成术语的类别与状态候选进行状态生成。此外,我们提出的特殊状态“未提及(not mentioned)”使更多术语可用,并丰富了第二阶段的训练数据,这在低资源设定下尤为关键。在 Chunyu 与 CMDD 数据集上的实验表明,所提方法在全量训练与低资源设定下均优于当前最优(SOTA)模型。
引用
@article{arxiv.2307.16200,
title = {A Knowledge-enhanced Two-stage Generative Framework for Medical Dialogue Information Extraction},
author = {Zefa Hu and Ziyi Ni and Jing Shi and Shuang Xu and Bo Xu},
journal= {arXiv preprint arXiv:2307.16200},
year = {2024}
}
备注
Published in Machine Intelligence Research, https://link.springer.com/article/10.1007/s11633-023-1461-5