KU-DMIS-MSRA 在 RadSum23 上的工作:用于放射学报告摘要生成的预训练视觉-语言模型
计算与语言
2023-07-17 v1 人工智能
图像与视频处理
摘要
在本文中,我们介绍了 CheXOFA,一种用于胸部 X 光领域的新型预训练视觉-语言模型(VLM)。我们的模型最初在通用领域内的各种多模态数据集上进行了预训练,然后迁移到胸部 X 光领域。遵循一个杰出的 VLM,我们将各种领域特定任务统一为简单的序列到序列模式。这使得模型能够从该领域有限资源中有效学习所需的知识与技能。我们的模型在 BioNLP 共享任务提供的基准数据集上展现出优越性能,这得益于其在多任务和多领域上的训练。借助包括集成与事实校准在内的精细技术,我们的系统在 RadSum23 隐藏测试集的排行榜上获得第一名。
引用
@article{arxiv.2307.07409,
title = {KU-DMIS-MSRA at RadSum23: Pre-trained Vision-Language Model for Radiology Report Summarization},
author = {Gangwoo Kim and Hajung Kim and Lei Ji and Seongsu Bae and Chanhwi Kim and Mujeen Sung and Hyunjae Kim and Kun Yan and Eric Chang and Jaewoo Kang},
journal= {arXiv preprint arXiv:2307.07409},
year = {2023}
}
备注
Published at BioNLP workshop @ ACL 2023