“我懂它何时何地”:连接与表达视觉概念的情绪空间
计算机视觉与模式识别
2025-04-22 v1
摘要
当概念可以被标记或量化时,表达复杂概念较为容易,但许多想法难以定义却一目了然。我们提出了情绪板 (Mood Board),用户通过示例来传递抽象概念,这些示例暗示了属性变化的意图方向。我们计算底层情绪空间 (Mood Space),以实现 (1) 消除无关特征和 (2) 在图像之间寻找联系,从而将相关概念 brought closer。我们发明了一种纤维计算 (fibration computation) 将预训练特征压缩/解压到紧凑空间中,缩小 50-100 倍。主要创新在于学习模仿跨示例中图像标记之间的两两亲缘关系。为聚焦情绪空间中的粗到细层次结构,我们计算亲缘矩阵的前特征向量结构,并定义在特征向量空间中的损失。 resulting Mood Space 在局部线性且紧凑,允许进行图像级操作,如对象平均、视觉类比和姿态迁移,可作为 Mood Space 中的简单向量操作来执行。我们的学习在计算上高效,无需任何微调,只需少量示例 (2-20 个),且耗时不到一分钟。
引用
@article{arxiv.2504.15145,
title = {"I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts},
author = {Huzheng Yang and Katherine Xu and Michael D. Grossberg and Yutong Bai and Jianbo Shi},
journal= {arXiv preprint arXiv:2504.15145},
year = {2025}
}
备注
Project page: https://huzeyann.github.io/mspace/