预训练纯文本 Transformer 中的多模态神经元
计算机视觉与模式识别
2023-10-03 v2 计算与语言
摘要
语言模型展现出将一种模态中学习到的表征泛化到其它模态下游任务的显著能力。我们能否将这种能力追溯到单个神经元?我们研究如下情形:一个冻结的文本 Transformer 通过自监督视觉编码器和在图像到文本任务上学习的单个线性投影来增强视觉能力。投影层的输出并不能立即被解码为描述图像内容的语言;相反,我们发现模态间的转换发生在 Transformer 更深层。我们提出了一种识别“多模态神经元”的流程,这些神经元将视觉表征转换为相应的文本,并解码它们注入模型残差流中的概念。在一系列实验中,我们表明多模态神经元在跨输入时作用于特定视觉概念,并对图像描述具有系统性因果效应。
引用
@article{arxiv.2308.01544,
title = {Multimodal Neurons in Pretrained Text-Only Transformers},
author = {Sarah Schwettmann and Neil Chowdhury and Samuel Klein and David Bau and Antonio Torralba},
journal= {arXiv preprint arXiv:2308.01544},
year = {2023}
}
备注
Oral presentation at ICCV CLVL 2023