中文

用文本主成分分析描述图像集合

计算机视觉与模式识别 2022-10-24 v1 人工智能 计算与语言

摘要

我们旨在语义地描述一组图像,同时捕捉单张图像的属性及集合内的变化。我们的过程类似于主成分分析(PCA),其中投影向量的角色被生成的短语所取代。首先,生成与集合中图像具有最大平均语义相似度的质心短语,其中相似度的计算与生成均基于预训练的视觉-语言模型。然后,生成在相似度得分中产生最高变化的短语,使用相同的模型。下一个短语在潜空间中对最高方差短语正交的约束下最大化方差,过程依此继续。我们的实验表明,我们的方法能够令人信服地捕捉图像集合的本质,并在整个集合的语境下以语义有意义的方式描述个体元素。我们的代码可在 https://github.com/OdedH/textual-pca 获取。

关键词

引用

@article{arxiv.2210.12112,
  title  = {Describing Sets of Images with Textual-PCA},
  author = {Oded Hupert and Idan Schwartz and Lior Wolf},
  journal= {arXiv preprint arXiv:2210.12112},
  year   = {2022}
}

备注

Accepted to Findings of EMNLP'22