中文

BiCLIP:基于结构几何变换的数据域标准化

计算机视觉与模式识别 2026-04-14 v2 人工智能 计算与语言 机器学习

摘要

最近的视觉语言模型(VLM)进展展现出惊人的零样性能,但将这些模型适配到特定数据域仍是一个重大挑战。基于最近的理论洞察表明,独立训练的 VLM 彼此之间存在标准化变换关系,我们将这种理解扩展至数据域的概念。我们假设,不同数据域之间的图像特征通过一种可由少量锚点恢复的标准化几何变换相关联。少数样本分类提供了自然的对齐场景,因为有限的标注样本作为所需的锚点来估计这种变换。基于此假设,我们引入 BiCLIP 框架,对多模态特征应用针对性的变换以增强跨模态对齐。该方法以其极致的简单性和低参数占用为特征标志。广泛的在 11 个标准基准测试(包括 EuroSAT、DTD 和 FGVCAircraft)中的评估表明,BiCLIP 一致实现了最先进的结果。此外,我们通过分析所学习变换的正交性和角度分布,提供了对现有几何发现的经验验证,确认结构化对齐是稳健数据域适应的关键。代码可在 https://github.com/QuantitativeImagingLaboratory/BilinearCLIP 查阅。

关键词

引用

@article{arxiv.2603.08942,
  title  = {BiCLIP: Domain Canonicalization via Structured Geometric Transformation},
  author = {Pranav Mantini and Shishir K. Shah},
  journal= {arXiv preprint arXiv:2603.08942},
  year   = {2026}
}

备注

Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026