中文

TMF-RSE:结合区域语义与证据不确定性的三模态融合用于肺部严重程度评分

图像与视频处理 2026-07-07 v1 计算机视觉与模式识别

摘要

从胸部影像中准确量化肺部疾病严重程度对于临床决策和资源分配至关重要。我们提出了一个三模态深度学习框架TMF-RSE(Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty),该框架结合了来自二维胸部输入的外观特征、来自肺部分割掩膜的结构特征以及来自视觉语言模型(VLM)的语义特征,用于严重程度量化。我们的方法采用了互补融合机制,整合了跨模态的语义引导、结构先验和层次交互。该模型采用证据回归来提供严重程度预测和不确定性估计。在Per-COVID-19 CT和RALO数据集上的实验表明,TMF-RSE优于最近的基于Transformer的基线,在Per-COVID-19验证集上实现了4.02的MAE和0.9629的Pearson相关系数,在RALO地理范围上实现了0.339 MAE / 0.973 PC。

关键词

引用

@article{arxiv.2607.06356,
  title  = {TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring},
  author = {Fadi Abdeladhim Zidi and Salah Eddine Bekhouche and Abdellah Zakaria Sellam and Gaby Maroun and Fadi Dornaika and Cosimo Distante},
  journal= {arXiv preprint arXiv:2607.06356},
  year   = {2026}
}

备注

6 pages, 2 figures, 5 tables. IEEE conference format (IEEEtran). Submitted to AVSS 2026. Tri-modal fusion for lung severity scoring using appearance, segmentation, and VLM semantics with evidential uncertainty