具可解释性的诊断VLVAE:用于缺失模态下的鲁棒放射科报告的解耦对齐约束视觉语言变分自编码器
计算机视觉与模式识别
2025-11-11 v1 人工智能
机器学习
摘要
将医学图像与临床背景集成对于生成准确且具有临床可解释性的放射科报告至关重要。然而,当前的自动化方法常依赖资源密集型的大型语言模型(LLM)或静态知识图谱,且在现实临床数据中的两个根本性挑战面临困境:(1)缺失模态,例如临床背景不完整;(2)特征缠综,混合模态特有信息和共享信息导致融合次优且产生临床不可信的幻觉发现。为解决这些挑战,我们提出具可解释性的诊断VLVAE(DiA-gnostic VLVAE),通过解耦对齐实现鲁棒的放射科报告。该框架通过采用基于混合专家(MoE)的视觉语言变分自编码器(VLVAE)来解耦共享特征和模态特有特征,以实现对缺失模态的鲁棒性。约束优化目标 enforces 向量正交性和对齐,以防止次优融合。随后,一个紧凑的LLaMA-X解码器使用这些解耦表示生成报告。 在IU X-Ray和MIMIC-CXR数据集上,DiA分别实现了BLEU@4为0.266和0.134的竞争成绩。实验结果表明,所提方法显著优于最先进的模型。
关键词
引用
@article{arxiv.2511.05968,
title = {DiA-gnostic VLVAE: Disentangled Alignment-Constrained Vision Language Variational AutoEncoder for Robust Radiology Reporting with Missing Modalities},
author = {Nagur Shareef Shaik and Teja Krishna Cherukuri and Adnan Masood and Dong Hye Ye},
journal= {arXiv preprint arXiv:2511.05968},
year = {2025}
}
备注
Accepted for Oral Presentation at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), Main Technical Track