跨模态信息检索能否在无训练的情况下实现?
机器学习
2023-04-24 v1 人工智能
计算与语言
计算机视觉与模式识别
信息检索
摘要
来自预训练深度学习模型的编码表示(例如BERT文本嵌入、图像的倒数第二CNN层激活)传达了一组有益于信息检索的丰富特征。特定模态数据的嵌入占据其自身的高维空间,但可通过简单映射在无训练深度神经网络的情况下与另一模态在语义上对齐。在本文中,我们采用由最小二乘和奇异值分解(SVD)计算得到的用于Procrustes问题解的简单映射,作为跨模态信息检索的一种手段。即,给定某一模态(如文本)的信息,该映射帮助我们在另一模态(如图像)中定位语义等价的数据项。利用现成的预训练深度学习模型,我们在文本到图像和图像到文本检索任务中实验了上述简单跨模态映射。尽管简单,我们的映射表现相当好,在recall@10上达到最高77%的精度,可与那些需要代价高昂的神经网络训练和微调的方法相媲美。我们通过对比学习在预训练模型上改进了简单映射。对比学习可视为适当地偏置预训练编码器以增强跨模态映射质量。我们通过带门控的多层感知机(gMLP)这一简单神经架构进一步提升了性能。
引用
@article{arxiv.2304.11095,
title = {Is Cross-modal Information Retrieval Possible without Training?},
author = {Hyunjin Choi and Hyunjae Lee and Seongho Joe and Youngjune L. Gwon},
journal= {arXiv preprint arXiv:2304.11095},
year = {2023}
}