中文

跨模态医学表示对齐中的鸿沟

计算机视觉与模式识别 2026-02-24 v1 机器学习

摘要

在多模态学习中,CLIP 作为将不同模态映射到共享潜空间的方法已成为事实标准,通过将语义相似的表示拉近而推远不相似的表示。然而,基于 CLIP 的对比损失 exhibits unintended behaviors,不利于真正的语义对齐,导致稀疏且碎片化的潜空间。已知的模态鸿沟在标准文本和图像配对中部分缓解,但在更复杂的多模态场景中,如医学领域,仍未知且未解决。本文聚焦后者,揭示模态鸿沟亦存在于医学对齐中,并提出一种模态无关框架以闭合此鸿沟,确保语义相关的表示无论其来源模态均更加对齐。该方法增强了放射学图像与临床文本之间的对齐,改进了跨模态检索和图像描述生成。

关键词

引用

@article{arxiv.2602.20046,
  title  = {Closing the gap in multimodal medical representation alignment},
  author = {Eleonora Grassucci and Giordano Cicchetti and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2602.20046},
  year   = {2026}
}

备注

Accepted at MLSP2025