中文

面向食物图像到食谱检索的无偏跨模态表征学习

计算机视觉与模式识别 2026-01-07 v2 多媒体

摘要

本文解决在跨模态检索问题中为食谱和食物图像学习表征的挑战。由于食谱与其烹饪成品之间存在因果关系,将食谱视为描述菜肴视觉外观的文本来源进行表征学习,会导致偏差,误导图像与食谱的相似度判断。具体而言,由于烹饪过程、菜肴呈现以及图像捕获条件等因素,食物图像可能不等额地捕捉食谱中的每个细节。当前的表征学习倾向于捕捉主导的视觉-文本对齐,忽略决定检索相关性的细微变化。在本文中,我们使用因果理论来建模跨模态表征学习中的偏差。因果视角表明,食材是一种混杂变量来源,简单的后门调整可缓解偏差。通过因果干预,我们在食谱检索常规模型中加入额外项,以消除相似度判断中的潜在偏差。基于此理论驱动的表述,我们在Recipe1M数据集上证明了检索的准选性能(MedR=1),测试数据规模从1K、10K乃至50K都如此。我们还提出了一个即插即用的神经模块,本质上是一个多标签食材分类器,用于消除偏差。在Recipe1M数据集上,我们报告了新的跨模态检索最佳性能。

关键词

引用

@article{arxiv.2511.15201,
  title  = {Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval},
  author = {Qing Wang and Chong-Wah Ngo and Ee-Peng Lim},
  journal= {arXiv preprint arXiv:2511.15201},
  year   = {2026}
}

备注

Code link: https://github.com/GZWQ/Towards-Unbiased-Cross-Modal-Representation-Learning-for-Food-Image-to-Recipe-Retrieval