PULSAR:基于抽取医疗术语的预训练与黑盒大语言模型数据增强的患者问题摘要方法
计算与语言
2023-06-06 v1
摘要
医疗进展记录在记录患者住院历程(包括其病情、治疗计划及面向医疗提供者的任何更新)方面起着关键作用。以问题列表形式自动摘要患者的问题可帮助相关方理解患者状况,减轻工作负荷与认知偏差。BioNLP 2023 共享任务 1A 聚焦于从住院期间提供者的进展记录中生成诊断与问题列表。本文介绍我们针对该任务提出的方案,其集成了两个互补组件:一个组件采用大语言模型(LLM)进行数据增强;另一个是具有新颖预训练目标的抽取式摘要 LLM,用于生成以列表形式摘要的患者问题。我们的方案在所有提交该共享任务的系统中排名第二。我们的模型在开发与测试数据集上的表现表明,我们的方案在未知数据上更为鲁棒,较同等规模的更大模型提升高达 3.1 分。
引用
@article{arxiv.2306.02754,
title = {PULSAR: Pre-training with Extracted Healthcare Terms for Summarising Patients' Problems and Data Augmentation with Black-box Large Language Models},
author = {Hao Li and Yuping Wu and Viktor Schlegel and Riza Batista-Navarro and Thanh-Tung Nguyen and Abhinav Ramesh Kashyap and Xiaojun Zeng and Daniel Beck and Stefan Winkler and Goran Nenadic},
journal= {arXiv preprint arXiv:2306.02754},
year = {2023}
}
备注
Accepted by ACL 2023's workshop BioNLP 2023