中文

SPEER:基于内嵌实体检索的长临床摘要句子级规划

计算与语言 2024-09-30 v2

摘要

每次患者出院时,临床医生必须撰写一份长篇摘要。由于入院期间涵盖的大量独特临床概念,这项任务非常耗时。识别并覆盖显著实体对于摘要的临床实用性至关重要。我们在该任务上微调开源 LLM(Mistral-7B-Instruct 和 Zephyr-7B-beta),发现它们生成的摘要不完整且不忠实。为了增加实体覆盖率,我们训练了一个更小的、仅编码器模型来预测显著实体,这些实体被视为内容规划以指导 LLM。为了鼓励 LLM 关注源记录中的特定提及,我们提出了 SPEER:基于内嵌实体检索的句子级规划。具体而言,我们用特殊的 "{{ }}" 边界标记每个显著实体跨度,并指示 LLM 在生成每个句子之前检索标记的跨度。句子级规划作为一种状态跟踪形式,因为模型显式记录了它使用的实体。我们在约 167k 住院患者入院的大规模、多样化数据集上微调 Mistral 和 Zephyr 变体,并在 3 个数据集上进行评估。SPEER 在覆盖率和忠实度指标上均优于非引导和引导基线。

关键词

引用

@article{arxiv.2401.02369,
  title  = {SPEER: Sentence-Level Planning of Long Clinical Summaries via Embedded Entity Retrieval},
  author = {Griffin Adams and Jason Zucker and Noémie Elhadad},
  journal= {arXiv preprint arXiv:2401.02369},
  year   = {2024}
}

备注

COLM 2024