那是错误的肺!评估并改进面向医疗数据的无监督多模态编码器的可解释性
机器学习
2023-02-27 v2 人工智能
计算机视觉与模式识别
图像与视频处理
摘要
在电子健康记录(EHR)上预训练多模态模型提供了一种以最小监督迁移至下游任务的表征学习手段。近期的多模态模型在图像区域与句子间诱导出软局部对齐。这在医疗领域尤为引人关注,因为此类对齐可能突出图像中与自由文本描述特定现象相关的区域。尽管过往工作认为注意力“热力图”可以此种方式解释,但对此类对齐的评估甚少。我们将最先进的EHR多模态(图像与文本)模型的对齐结果与将图像区域关联到句子的人工标注进行比较。我们的主要发现是文本对注意力的影响常较弱或不直观;对齐并未一致反映基本解剖信息。此外,诸如将“左”替换为“右”的合成修改并未实质性影响高亮。允许模型选择不关注图像以及少样本微调等简单技术,在极少或无监督情况下改进对齐的能力上展现出前景。我们将代码与检查点开源。
引用
@article{arxiv.2210.06565,
title = {That's the Wrong Lung! Evaluating and Improving the Interpretability of Unsupervised Multimodal Encoders for Medical Data},
author = {Denis Jered McInerney and Geoffrey Young and Jan-Willem van de Meent and Byron C. Wallace},
journal= {arXiv preprint arXiv:2210.06565},
year = {2023}
}