用于视网膜疾病识别的多模态多示例学习
计算机视觉与模式识别
2021-09-28 v1 人工智能
多媒体
摘要
本文致力于应对一个新兴挑战:多模态视网膜疾病识别。给定一个由彩色眼底照(CFP)和一次眼科检查中采集的 OCT B 扫描图像阵列组成的多模态病例,我们旨在构建一个深度神经网络,用于识别该病例的多种致盲性眼病。由于 CFP 与 OCT 的诊断效力依疾病而不同,网络同时具备选择性与可解释性十分重要。此外,由于医学领域中的数据采集与人工标注均极为昂贵,网络必须相对轻量以从有限的标注多模态样本中学习。现有视网膜疾病识别研究或聚焦于单一疾病,或聚焦于单一模态,多模态融合在很大程度上未被充分探索。本文中我们提出多模态多示例学习(MM-MIL)来选择性地融合 CFP 与 OCT 模态。其轻量架构(相较于当前的多头注意力模块)使其适合从小规模数据集学习。为有效使用 MM-MIL,我们提出通过对给定 CFP 进行过采样来生成伪 CFP 序列。该策略的好处包括跨模态平衡示例、提高 CFP 输入分辨率,以及找出与最终诊断最相关的 CFP 区域。在一个由 836 名受试者的 1,193 只眼睛共 1,206 个多模态病例组成的真实世界数据集上的大量实验证明了所提模型的可行性。
引用
@article{arxiv.2109.12307,
title = {Multi-Modal Multi-Instance Learning for Retinal Disease Recognition},
author = {Xirong Li and Yang Zhou and Jie Wang and Hailan Lin and Jianchun Zhao and Dayong Ding and Weihong Yu and Youxin Chen},
journal= {arXiv preprint arXiv:2109.12307},
year = {2021}
}
备注
Accepted by ACM Multimedia 2021 (Main Track)