中文

Dia-LLaMA:迈向大语言模型驱动的CT报告生成

计算机视觉与模式识别 2024-03-26 v1 人工智能

摘要

医学报告生成已取得显著进展,但仍面临若干挑战。首先,正常与异常病例分布的内在不平衡可能导致模型偏向关注正常样本,从而产生不可靠的诊断。其次,报告中常见模板句子的频繁出现可能掩盖关键的异常信息。此外,现有工作集中于二维胸部X光片,由于CT图像的高维特性以及CT-报告对的有限可用性,CT报告生成尚未得到充分探索。近来,大语言模型(LLM)已展现出在适当提示下生成可靠答案的强大能力,为解决上述挑战带来了希望。在本文中,我们提出Dia-LLaMA,这是一个通过引入诊断信息作为引导提示来适配LLaMA2-7B以进行CT报告生成的框架。考虑到CT的高维度,我们利用预训练的ViT3D与perceiver来提取视觉信息。为了使LLM适应报告生成并强调异常,我们通过参考一个疾病原型记忆库来提取额外的诊断信息,该记忆库在训练期间更新以捕捉常见疾病表征。此外,我们引入了疾病感知注意力,使模型能够针对不同疾病调整注意力。在胸部CT数据集上的实验表明,我们提出的方法优于先前的方法,并在临床效能性能和自然语言生成指标上均达到了最先进水平。代码将公开发布。

关键词

引用

@article{arxiv.2403.16386,
  title  = {Dia-LLaMA: Towards Large Language Model-driven CT Report Generation},
  author = {Zhixuan Chen and Luyang Luo and Yequan Bie and Hao Chen},
  journal= {arXiv preprint arXiv:2403.16386},
  year   = {2024}
}

备注

10 pages