从条目化文本监督中学习完整且可解释的视觉表示
计算机视觉与模式识别
2026-03-18 v2
摘要
使用语言监督训练视觉模型能够产生具有通用性和可迁移性的表示。然而,许多视觉领域,尤其是医学成像和遥感等非以目标为中心的领域,包含条目化文本标注:多个描述单张图像中独立且语义独立发现的文本条目。这种监督不同于标准的多标题监督,后者的标题是冗余或高度重叠的。在此,我们引入了 ItemizedCLIP,一个从条目化文本监督中学习完整且可解释视觉表示的框架。ItemizedCLIP 采用交叉注意力模块来生成以文本条目为条件的视觉嵌入,并使用一组量身定制的目标函数,共同强制执行条目独立性(不同条目对应不同区域)和表示完整性(覆盖所有条目)。在四个具有自然条目化文本监督的领域(脑部 MRI、头部 CT、胸部 CT、遥感)以及一个额外的合成条目化数据集上,ItemizedCLIP 在零样本性能和细粒度可解释性方面均取得了相对于基线的显著提升。生成的 ItemizedCLIP 表示具有语义基础、条目可分性、完整性以及视觉可解释性。我们的代码可在 https://github.com/MLNeurosurg/ItemizedCLIP 获取。
引用
@article{arxiv.2512.11141,
title = {Learning complete and explainable visual representations from itemized text supervision},
author = {Yiwei Lyu and Chenhui Zhao and Soumyanil Banerjee and Shixuan Liu and Akshay Rao and Akhil Kondepudi and Honglak Lee and Todd C. Hollon},
journal= {arXiv preprint arXiv:2512.11141},
year = {2026}
}