从你开始:感知初始化提升视觉语言表示与对齐
计算机视觉与模式识别
2025-05-21 v1 神经元与认知
摘要
我们引入感知初始化(Perceptual-Initialization, PI),这是一种视觉表示学习的范式转变,旨在在初始化阶段而非后续微调阶段融合人类感知结构。通过将来自NIGHTS数据集中人类感知嵌入用于初始化CLIP视觉编码器,然后在YFCC15M上进行自监督学习,我们的方法在29个零样本分类和检索基准测试中展现出显著的零样本性能提升,无需任何任务特定的微调。在ImageNet-1K上,零样本性能提升约需15个预训练周期。该方法在不同规模的数据集上均能获益,提升在预训练过程中呈现不同程度,取决于数据集特征。我们的方法在多样化评估任务中持续增强零样本top-1准确率、top-5准确率和检索召回率(例如R@1、R@5),无需针对目标领域进行适配。这些发现挑战了将人类感知数据主要用于微调的常规观念,表明在早期表示学习中嵌入人类感知结构可构建更具能力和更符合视觉语言对齐的系统,能够立即泛化到未见任务。我们的工作表明,“从你开始”,即从人类感知出发,可为通用视觉语言智能提供更强的基础。
引用
@article{arxiv.2505.14204,
title = {Beginning with You: Perceptual-Initialization Improves Vision-Language Representation and Alignment},
author = {Yang Hu and Runchen Wang and Stephen Chong Zhao and Xuhui Zhan and Do Hun Kim and Mark Wallace and David A. Tovar},
journal= {arXiv preprint arXiv:2505.14204},
year = {2025}
}
备注
10 pages, 5 figures, 2 tables