中文

通过最大化局部互信息的多模态表示学习

图像与视频处理 2021-12-16 v5 计算机视觉与模式识别

摘要

我们提出并展示了一种通过最大化图像与文本的局部特征间互信息来进行表示学习的方法。该方法的目的是利用描述图像中发现的发现的自由文本所包含的丰富信息,来学习有用的图像表示。我们的方法通过促使所得表示展现出高局部互信息来训练图像与文本编码器。我们利用神经网络判别器在互信息估计上的近期进展。我们认为局部互信息之和通常是全局互信息的一个下界。我们在下游图像分类任务中的实验结果展示了使用局部特征进行图像-文本表示学习的优势。

关键词

引用

@article{arxiv.2103.04537,
  title  = {Multimodal Representation Learning via Maximization of Local Mutual Information},
  author = {Ruizhi Liao and Daniel Moyer and Miriam Cha and Keegan Quigley and Seth Berkowitz and Steven Horng and Polina Golland and William M. Wells},
  journal= {arXiv preprint arXiv:2103.04537},
  year   = {2021}
}

备注

In Proceedings of International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI), 2021