FMiFood:用于食物图像分类的多模态对比学习
计算机视觉与模式识别
2024-08-08 v1
摘要
食物图像分类是基于图像的膳食评估的基础步骤,旨在从进食场景图像中估计参与者的营养摄入。食物图像的常见挑战是类内多样性与类间相似性,这会显著阻碍分类性能。为解决此问题,我们提出了一种新颖的多模态对比学习框架FMiFood,通过整合额外的上下文信息(如食物类别文本描述)来学习更具判别性的特征,从而提升分类准确率。具体而言,我们提出了一种灵活的匹配技术,改善文本与图像嵌入之间的相似性匹配,以聚焦于多关键信息。此外,我们将分类目标纳入框架,并探索使用GPT-4来丰富文本描述,提供更详细的上下文。我们的方法在UPMC-101和VFN数据集上均优于现有方法。
引用
@article{arxiv.2408.03922,
title = {FMiFood: Multi-modal Contrastive Learning for Food Image Classification},
author = {Xinyue Pan and Jiangpeng He and Fengqing Zhu},
journal= {arXiv preprint arXiv:2408.03922},
year = {2024}
}