中文

F4-ITS:面向食物图像-文本搜索的细粒度特征融合

计算机视觉与模式识别 2025-08-26 v1

摘要

数字食物内容的不断增长加剧了对具备细粒度视觉理解与检索能力的稳健、精准系统需求。本文针对食物图像到文本匹配这一具有挑战性的任务,提出F4-ITS:面向食物图像-文本搜索的细粒度特征融合,一个无需训练、由视觉-语言模型(VLM)导向的框架,通过增强多模态特征表征显著�提升检索性能。我们的方法包含两个关键贡献:(1) 一种单向(及双向)多模态融合策略,将图像嵌入与VLM生成的文本描述相结合,以提升查询的表达力;(2) 一种基于特征的前k检索重新排序机制,利用预测的食物原料来细化结果并提升精度。借助开源图像-文本编码器,我们展示在稠密和稀疏标题场景下,顶部-1检索分别实现约10%和7.7%的提升,顶部k原料级检索实现约28.6%的提升。此外,我们表明较小模型(如ViT-B/32)在文本融合增强后可匹配或超越更大模型(ViT-H、ViT-G、ViT-bigG),凸显了该方法在资源受限环境中的有效性。代码与测试数据集将发布于:https://github.com/mailcorahul/f4-its

关键词

引用

@article{arxiv.2508.17037,
  title  = {F4-ITS: Fine-grained Feature Fusion for Food Image-Text Search},
  author = {Raghul Asokan},
  journal= {arXiv preprint arXiv:2508.17037},
  year   = {2025}
}