在医学报告摘要生成中利用摘要引导
计算与语言
2023-02-09 v1 人工智能
摘要
本研究提出三个去标识化的大型医学文本数据集,名为 DISCHARGE、ECHO 和 RADIOLOGY,分别包含从 MIMIC-III 衍生的 50K、16K 和 378K 对报告与摘要。我们使用预训练编码器-解码器语言模型(包括 BERT2BERT、T5-large 和 BART)在所提数据集上实现了有说服力的抽象式摘要基线。进一步,基于 BART 模型,我们利用从训练集采样的摘要作为先验知识引导,用编码器编码该引导的额外上下文表示,并增强解码器中的解码表示。实验结果证实了所提方法在 ROUGE 分数与 BERTScore 上的提升,优于更大的模型 T5-large。
引用
@article{arxiv.2302.04001,
title = {Leveraging Summary Guidance on Medical Report Summarization},
author = {Yunqi Zhu and Xuebing Yang and Yuanyuan Wu and Wensheng Zhang},
journal= {arXiv preprint arXiv:2302.04001},
year = {2023}
}