通过跨模型对齐实现文本到概念(及反向)
计算机视觉与模式识别
2023-05-12 v1 人工智能
人机交互
机器学习
摘要
我们观察到,一个模型中图像表征到另一模型中其表征的映射仅需一个线性层即可惊人地良好学习,即便跨多样模型也是如此。基于该观察,我们提出(text-to-concept),其中来自固定预训练模型的特征被线性对齐到CLIP空间,从而使CLIP文本编码器的文本嵌入可直接与对齐后的特征比较。借助文本到概念,我们将固定的现成视觉编码器免费转换为惊人的强零样本分类器,其准确率有时甚至超越CLIP,尽管模型小得多且训练数据量远小于CLIP。我们展示了文本到概念的其他直接用例,如构建无概念监督的概念瓶颈模型、以人类概念诊断分布偏移,以及检索满足一组基于文本约束的图像。最后,我们证明了(concept-to-text)的可行性,其中模型特征空间中的向量先对齐到CLIP,再输入基于GPT的生成模型进行解码。我们的工作表明,现有深度模型(架构与训练 presumably 多样)对输入样本的表征相对相似,且跨模型表征空间并与人类(通过语言)的双向交流是可行的。
引用
@article{arxiv.2305.06386,
title = {Text-To-Concept (and Back) via Cross-Model Alignment},
author = {Mazda Moayeri and Keivan Rezaei and Maziar Sanjabi and Soheil Feizi},
journal= {arXiv preprint arXiv:2305.06386},
year = {2023}
}
备注
Accepted to ICML 2023 and CVPR4XAI workshop 2023