跨模态检索中从配对数据学习解耦隐变量:一种隐式可辨识VAE方法
机器学习
2020-12-02 v1 计算机视觉与模式识别
摘要
我们研究在跨模态检索中学习成对双模态数据间共享的底层解耦隐变量的问题。我们的假设是,两种模态中的数据均为复杂、结构化且高维的(如图像与文本),对此常规深度自编码隐变量模型(如变分自编码器(VAE))常面临精确解码器训练或真实合成的困难。次优训练的解码器可能损害模型辨识真实因子的能力。本文提出隐式解码器的全新思路,通过低维嵌入函数的雅可比正则化实现隐式编码器反演,从而将环境数据解码模块从隐变量模型中完全移除。受近期可辨识VAE(IVAE)模型启发,我们对其修改以将查询模态数据作为条件辅助输入,从而在某些正则条件下证明模型真实参数可被辨识。在真实因子完全/部分可用的多个数据集上测试,我们的模型能准确辨识因子,显著优于常规编码器-解码器隐变量模型。我们还在大规模食物图像/食谱数据集Recipe1M上测试,所学因子与广泛认可的最显著食物因子高度吻合,包括咸度、水度和绿度。
引用
@article{arxiv.2012.00682,
title = {Learning Disentangled Latent Factors from Paired Data in Cross-Modal Retrieval: An Implicit Identifiable VAE Approach},
author = {Minyoung Kim and Ricardo Guerrero and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:2012.00682},
year = {2020}
}