用文本主成分分析描述图像集合
计算机视觉与模式识别
2022-10-24 v1 人工智能
计算与语言
摘要
我们旨在语义地描述一组图像,同时捕捉单张图像的属性及集合内的变化。我们的过程类似于主成分分析(PCA),其中投影向量的角色被生成的短语所取代。首先,生成与集合中图像具有最大平均语义相似度的质心短语,其中相似度的计算与生成均基于预训练的视觉-语言模型。然后,生成在相似度得分中产生最高变化的短语,使用相同的模型。下一个短语在潜空间中对最高方差短语正交的约束下最大化方差,过程依此继续。我们的实验表明,我们的方法能够令人信服地捕捉图像集合的本质,并在整个集合的语境下以语义有意义的方式描述个体元素。我们的代码可在 https://github.com/OdedH/textual-pca 获取。
引用
@article{arxiv.2210.12112,
title = {Describing Sets of Images with Textual-PCA},
author = {Oded Hupert and Idan Schwartz and Lior Wolf},
journal= {arXiv preprint arXiv:2210.12112},
year = {2022}
}
备注
Accepted to Findings of EMNLP'22