中文

RepsNet:结合视觉与语言实现自动化医疗报告生成

计算机视觉与模式识别 2022-09-28 v1

摘要

通过分析医疗图像撰写报告对经验不足者易出错,对经验丰富者则耗时。本工作中,我们提出RepsNet,它适配预训练的视觉与语言模型以解读医疗图像并生成自然语言自动化报告。RepsNet由编码器-解码器模型构成:编码器通过对比学习将图像与自然语言描述对齐,而解码器基于编码图像及由最近邻搜索检索到的描述先验上下文预测答案。我们将该问题建模为视觉问答设定,以处理分类性与描述性自然语言答案。我们在放射影像数据集上针对医疗视觉问答(VQA-Rad)与报告生成(IU-Xray)两项挑战性任务开展实验。结果表明,RepsNet优于当前最优方法,在VQA-Rad 2018上分类准确率达81.08%,在IU-Xray上BLEU-1得分为0.58。补充细节见 https://sites.google.com/view/repsnet

关键词

引用

@article{arxiv.2209.13171,
  title  = {RepsNet: Combining Vision with Language for Automated Medical Reports},
  author = {Ajay Kumar Tanwani and Joelle Barral and Daniel Freedman},
  journal= {arXiv preprint arXiv:2209.13171},
  year   = {2022}
}