视觉词典:语言空间中的丰富图像特征
计算机视觉与模式识别
2024-12-10 v1 人工智能
机器学习
摘要
我们提出视觉词典(Visual Lexicon),一种新颖的视觉语言,将丰富的图像信息编码到词汇标记的文本空间中,同时保留通常在自然语言中难以传达的精细视觉细节。与传统方法优先处理高层语义(如 CLIP)或像素级重建(如 VAE)不同,ViLex 同时捕捉丰富的语义内容和精细的视觉细节,从而实现高质量的图像生成和全面的视觉场景理解。通过自监督学习流程,ViLex 生成经过优化的标记,用于通过冻结的文本到图像(T2I)扩散模型重建输入图像,保留了高保真语义级重建所需的详细信息。作为语言空间中的图像嵌入,ViLex 标记利用自然语言的组合性,允许它们独立用作"文本标记"或与自然语言标记组合,以同时接收视觉和文本输入来提示预训练的 T2I 模型,模拟我们与视觉语言模型(VLMs)的交互方式。实验表明 ViLex 在图像重建方面比文本嵌入实现了更高的保真度——即使仅使用单个 ViLex 标记。此外,ViLex 在无需微调 T2I 模型的情况下,以零样本、无监督的方式成功执行各种 DreamBooth 任务。ViLex 作为一个强大的视觉编码器,相对于强大的 SigLIP 基线,在 15 个基准测试中持续提升视觉语言模型的性能。
引用
@article{arxiv.2412.06774,
title = {Visual Lexicon: Rich Image Features in Language Space},
author = {XuDong Wang and Xingyi Zhou and Alireza Fathi and Trevor Darrell and Cordelia Schmid},
journal= {arXiv preprint arXiv:2412.06774},
year = {2024}
}
备注
Tech report. 16 pages, 10 figures