跨越真实世界语言导向视觉概念学习的鸿沟
计算机视觉与模式识别
2025-11-11 v2
摘要
人类智慧能够轻松地解释沿着丰富语义维度的视觉场景。然而,现有的语言导向视觉概念学习方法受限于仅几个预定义的原始轴,如颜色和形状,通常在合成数据集中探索。在本工作中,我们提出了一个可扩展框架,自适应地识别图像相关概念轴并在这些轴上对视觉概念进行语言对齐。利用预训练的视觉语言模型和我们的通用提示策略,该框架在没有任何先验知识的情况下识别出多样化的图像相关轴。我们的通用概念编码器在不为每个概念引入额外模型参数的情况下自适应地将视觉特征绑定到所发现的轴上。为了在所发现的轴上对视觉概念进行对齐,我们优化了一种组成性锚定目标,确保每个轴可以独立地被操控而不会影响其他轴。我们在ImageNet、CelebA-HQ和AFHQ的子集上展示了该框架的有效性,展示了在跨越广泛真实世界概念的卓越编辑能力,这些概念太为众多而无法手动预定义。我们的方法也表现出强大的组成推理能力,超越现有的视觉概念学习和基于文本的编辑方法。代码可在https://github.com/whieya/Language-grounded-VCL获取。
引用
@article{arxiv.2510.21412,
title = {Bridging the gap to real-world language-grounded visual concept learning},
author = {Whie Jung and Semin Kim and Junee Kim and Seunghoon Hong},
journal= {arXiv preprint arXiv:2510.21412},
year = {2025}
}