中文

实质还是风格:你的图像嵌入知道什么?

机器学习 2023-07-13 v1 人工智能 计算机视觉与模式识别

摘要

探针是小型网络,用于从嵌入中预测底层数据的属性,它们提供了一种有针对性且有效的方式来揭示嵌入中所包含的信息。尽管通过探针进行分析在 NLP 中已成为标准,但在视觉领域探索甚少。图像基础模型主要被评估其语义内容。更好地理解流行嵌入(例如 MAE、SimCLR 或 CLIP)中的非语义信息,将为训练算法及这些基础模型的用途带来新的启示。我们设计了一项系统的变换预测任务,并沿多个维度(包括图像风格、质量以及一系列自然与人工变换)度量嵌入的视觉内容。令人惊讶的是,六种嵌入(包括 SimCLR)编码了足够的非语义信息以识别数十种变换。我们还考虑了一项泛化任务,将相似变换分组并留出若干用于测试。我们发现图像-文本模型(CLIP 和 ALIGN)比基于掩码的模型(CAN 和 MAE)更擅长识别风格迁移的新样例。总体而言,我们的结果表明预训练算法的选择会影响嵌入中的信息类型,且某些模型在非语义下游任务上优于其他模型。

关键词

引用

@article{arxiv.2307.05610,
  title  = {Substance or Style: What Does Your Image Embedding Know?},
  author = {Cyrus Rashtchian and Charles Herrmann and Chun-Sung Ferng and Ayan Chakrabarti and Dilip Krishnan and Deqing Sun and Da-Cheng Juan and Andrew Tomkins},
  journal= {arXiv preprint arXiv:2307.05610},
  year   = {2023}
}

备注

27 pages, 9 figures