中文

针对多文化图像到食谱检索消除跨模态表示偏差

计算机视觉与模式识别 2025-10-24 v1 多媒体

摘要

现有的图像到食谱检索方法隐含地假设食物图像能完全捕捉其配方中所记录的细节。然而,食物图像仅反映烹饪菜品的视觉结果,而非 underlying 烹饪过程。因此,学习跨模态表示以弥合图像和食谱之间的模态差距,倾向于忽略那些在视觉上不明显却对于食谱检索至关重要的细微配方细节。具体而言,表征学习偏向于捕捉占主导地位的视觉元素,导致难以对排名相似食谱(在用料和烹饪方法上有细微差异)进行排序。当训练数据由来自不同烹饪文化的图像和食谱混合时,这种表示学习偏差预计会更为严重。本文提出了一种新颖的因果方法,预测图像中可能被忽略的烹饪元素,同时显式地将这些元素注入跨模态表示学习,以消除偏差。我们在标准单语 Recipe1M 数据集和一个新精选的多语言多文化烹饪数据集上进行实验。结果表明,所提出的因果表示学习能够发现细微的食材和烹饪动作,并在单语和多语言多文化数据集上实现令人瞩目的检索性能。

关键词

引用

@article{arxiv.2510.20393,
  title  = {Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval},
  author = {Qing Wang and Chong-Wah Ngo and Yu Cao and Ee-Peng Lim},
  journal= {arXiv preprint arXiv:2510.20393},
  year   = {2025}
}

备注

ACM Multimedia 2025