面向食物图像到食谱检索的无偏跨模态表征学习
计算机视觉与模式识别
2026-01-07 v2 多媒体
摘要
本文解决在跨模态检索问题中为食谱和食物图像学习表征的挑战。由于食谱与其烹饪成品之间存在因果关系,将食谱视为描述菜肴视觉外观的文本来源进行表征学习,会导致偏差,误导图像与食谱的相似度判断。具体而言,由于烹饪过程、菜肴呈现以及图像捕获条件等因素,食物图像可能不等额地捕捉食谱中的每个细节。当前的表征学习倾向于捕捉主导的视觉-文本对齐,忽略决定检索相关性的细微变化。在本文中,我们使用因果理论来建模跨模态表征学习中的偏差。因果视角表明,食材是一种混杂变量来源,简单的后门调整可缓解偏差。通过因果干预,我们在食谱检索常规模型中加入额外项,以消除相似度判断中的潜在偏差。基于此理论驱动的表述,我们在Recipe1M数据集上证明了检索的准选性能(MedR=1),测试数据规模从1K、10K乃至50K都如此。我们还提出了一个即插即用的神经模块,本质上是一个多标签食材分类器,用于消除偏差。在Recipe1M数据集上,我们报告了新的跨模态检索最佳性能。
引用
@article{arxiv.2511.15201,
title = {Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval},
author = {Qing Wang and Chong-Wah Ngo and Ee-Peng Lim},
journal= {arXiv preprint arXiv:2511.15201},
year = {2026}
}
备注
Code link: https://github.com/GZWQ/Towards-Unbiased-Cross-Modal-Representation-Learning-for-Food-Image-to-Recipe-Retrieval