中文

SIMMER:基于 MLLM 嵌入的跨模态食物图像-食谱检索

计算机视觉与模式识别 2026-04-20 v1 计算与语言 信息检索 机器学习 多媒体

摘要

食物图像与食谱文本之间的跨模态检索是一项重要任务,在营养管理、饮食记录和烹饪辅助中具有应用价值。现有方法主要依赖于具有独立图像和文本编码器的双编码器架构,需要复杂的对齐策略和特定于任务的网络设计来弥合模态之间的语义鸿沟。在这项工作中,我们提出了 SIMMER(用于食谱嵌入的单集成多模态模型),它将基于多模态大语言模型(MLLM)的嵌入模型(具体为 VLM2Vec)应用于此任务,用处理食物图像和食谱文本的单一统一编码器取代了传统的双编码器范式。我们设计了针对食谱结构化特性(由标题、成分和烹饪说明组成)量身定制的提示模板,使 MLLM 能够生成有效的嵌入。我们进一步引入了一种组件感知数据增强策略,在完整和不完整的食谱上训练模型,提高了对不完整输入的鲁棒性。在 Recipe1M 数据集上的实验表明,SIMMER 在 1k 和 10k 评估设置下均实现了 SOTA 性能,大幅超越了所有先前的方法。特别是,与先前的最佳方法相比,我们最好的模型将 1k 图像到食谱的 R@1 从 81.8% 提升至 87.5%,将 10k 图像到食谱的 R@1 从 56.5% 提升至 65.5%。

关键词

引用

@article{arxiv.2604.15628,
  title  = {SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding},
  author = {Keisuke Gomi and Keiji Yanai},
  journal= {arXiv preprint arXiv:2604.15628},
  year   = {2026}
}

备注

20 pages, 6 figures