跨模态医学表示对齐中的鸿沟
计算机视觉与模式识别
2026-02-24 v1 机器学习
摘要
在多模态学习中,CLIP 作为将不同模态映射到共享潜空间的方法已成为事实标准,通过将语义相似的表示拉近而推远不相似的表示。然而,基于 CLIP 的对比损失 exhibits unintended behaviors,不利于真正的语义对齐,导致稀疏且碎片化的潜空间。已知的模态鸿沟在标准文本和图像配对中部分缓解,但在更复杂的多模态场景中,如医学领域,仍未知且未解决。本文聚焦后者,揭示模态鸿沟亦存在于医学对齐中,并提出一种模态无关框架以闭合此鸿沟,确保语义相关的表示无论其来源模态均更加对齐。该方法增强了放射学图像与临床文本之间的对齐,改进了跨模态检索和图像描述生成。
引用
@article{arxiv.2602.20046,
title = {Closing the gap in multimodal medical representation alignment},
author = {Eleonora Grassucci and Giordano Cicchetti and Danilo Comminiello},
journal= {arXiv preprint arXiv:2602.20046},
year = {2026}
}
备注
Accepted at MLSP2025