基于检索的利用自然语言监督的解耦表示学习
计算与语言
2024-02-13 v2 人工智能
计算机视觉与模式识别
摘要
解耦表示学习仍然具有挑战性,因为数据中潜在的变异因素并非自然存在。真实世界数据固有的复杂性使得在有限的因子集合内穷举并封装其所有变体变得不可行。然而,值得注意的是,大多数真实世界数据都有语言等价物,通常表现为文本描述的形式。这些语言对应物可以表示数据,并能轻松地分解为不同的词元。有鉴于此,我们提出词汇解耦检索(VDR),一种基于检索的框架,利用自然语言作为底层数据变异的代理来驱动解耦表示学习。我们的方法采用双编码器模型在词汇空间中表示数据和自然语言,使模型能够通过数据的自然语言对应物区分捕捉数据内在特征的维度,从而促进解耦。我们在15个检索基准数据集上广泛评估了VDR的性能,涵盖文本到文本和跨模态检索场景,以及人工评估。我们的实验结果有力地证明了VDR优于先前具有相当模型规模和训练成本的双编码器检索器,在零样本设定下,于BEIR基准上NDCG@10提升8.7%,于MS COCO上提升5.3%,于Flickr30k上平均召回率提升6.0%。此外,人工评估结果表明,我们方法的可解释性与SOTA描述生成模型相当。
引用
@article{arxiv.2212.07699,
title = {Retrieval-based Disentangled Representation Learning with Natural Language Supervision},
author = {Jiawei Zhou and Xiaoguang Li and Lifeng Shang and Xin Jiang and Qun Liu and Lei Chen},
journal= {arXiv preprint arXiv:2212.07699},
year = {2024}
}