用于眼科报告生成的跨模态临床图 Transformer
计算机视觉与模式识别
2022-06-07 v1
摘要
利用数据驱动的神经网络自动生成眼科报告在临床实践中具有巨大潜力。眼科医生在撰写报告时,会借助先验临床知识进行推断。这一知识在以往的医学报告生成方法中被忽视。为使模型具备融入专家知识的能力,我们提出了一种用于眼科报告生成(ORG)的跨模态临床图 Transformer(CGT),其中临床关系三元组作为先验知识注入视觉特征以驱动解码过程。然而,两个主要的常见知识噪声(KN)问题可能影响模型的有效性。1)现有的如 UMLS 等通用生物医学知识库可能无法与报告的具体上下文和语言有意义地对齐,限制了其知识注入的效用。2)注入过多知识可能使视觉特征偏离其正确含义。为克服这些局限,我们设计了一种基于自然语言处理的自动信息抽取方案,直接从领域内训练报告中获取临床实体与关系。给定一组眼科图像,我们的 CGT 首先从临床图中恢复子图,并将恢复的三元组注入视觉特征。随后在编码过程中采用可见矩阵以限制知识的影响。最后,通过 Transformer 解码器由编码后的跨模态特征预测报告。在大规模 FFA-IR 基准上的大量实验表明,所提出的 CGT 能够超越以往的基准方法并取得最先进的性能。
引用
@article{arxiv.2206.01988,
title = {Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation},
author = {Mingjie Li and Wenjia Cai and Karin Verspoor and Shirui Pan and Xiaodan Liang and Xiaojun Chang},
journal= {arXiv preprint arXiv:2206.01988},
year = {2022}
}
备注
CVPR 2022 (Poster)