对比视觉语义预训练放大自然语言表征的语义性
计算与语言
2022-03-16 v1 人工智能
计算机与社会
机器学习
摘要
我们通过比较GPT-2与CLIP(一种适配GPT-2架构以编码图像描述词的零样本多模态图像分类器)所形成的上下文英语语言表征的几何与语义特性,考察对比视觉语义预训练的影响。我们发现对比视觉语义预训练显著缓解了GPT-2上下文词嵌入中的各向异性,使得CLIP词嵌入的层内自相似度(平均成对余弦相似度)在所有层均低于0.25,而GPT-2顶层则大于0.95。CLIP词嵌入在词级语义内在评测任务上优于GPT-2,并在RG65评测上以0.88取得新的基于语料的state of the art。CLIP还形成了细粒度的句子语义表征,并在无需微调的SemEval-2017语义文本相似度基准上获得Spearman's rho = 0.73,而GPT-2任意层均不超过rho = 0.45。最后,CLIP句子嵌入的层内自相似度随层索引增加而下降,顶层为0.25,而使用EOS token形成的GPT-2句子嵌入自相似度逐层上升且从未低于0.97。我们的结果表明高各向异性并非上下文化的必然结果,且视觉语义预训练不仅有益于排序视觉表征,也有益于在词级与句级编码有用的语言语义表征。
引用
@article{arxiv.2203.07511,
title = {Contrastive Visual Semantic Pretraining Magnifies the Semantics of Natural Language Representations},
author = {Robert Wolfe and Aylin Caliskan},
journal= {arXiv preprint arXiv:2203.07511},
year = {2022}
}
备注
To be published in ACL 2022