中文

两种临床笔记生成模型设计的比较:大语言模型能否有效评估一致性?

计算与语言 2024-04-10 v1

摘要

在与患者互动后,医生负责提交临床文档,通常组织为SOAP笔记。临床笔记不仅仅是对话的摘要,还需要使用适当的医学术语。相关信息随后可根据SOAP笔记的结构提取和组织。本文分析了两种基于对话录音生成SOAP笔记不同部分的方法,并特别从笔记一致性的角度进行了检验。第一种方法独立生成各部分,而第二种方法则同时生成所有部分。我们使用了PEGASUS-X Transformer模型,观察到两种方法产生了相似的ROUGE值(差异小于1%),且在事实性指标上无差异。我们进行了人工评估以衡量一致性方面,并证明像Llama2这样的大语言模型可用于执行相同任务,且与人工标注者的一致性大致相同。在Llama2分析与人工评审之间,我们观察到年龄、性别和身体部位损伤一致性的Cohen Kappa评分者间信度分别为0.79、1.00和0.32。由此,我们展示了利用大语言模型衡量人类可识别但当前自动指标无法捕获的质量指标的有效性。这使得评估可扩展到更大的数据集,并且我们发现,通过基于所有先前生成部分的输出来生成每个新部分,临床笔记的一致性得到了提高。

关键词

引用

@article{arxiv.2404.06503,
  title  = {Comparing Two Model Designs for Clinical Note Generation; Is an LLM a Useful Evaluator of Consistency?},
  author = {Nathan Brake and Thomas Schaaf},
  journal= {arXiv preprint arXiv:2404.06503},
  year   = {2024}
}

备注

Accepted to NAACL 2024 Findings