中文

通过视觉- ingred ient 特征融合提升食物营养估计

计算机视觉与模式识别 2025-05-14 v1 人工智能

摘要

营养估计是促进健康饮食和缓解饮食相关健康风险的重要组成部分。尽管在食物分类和 ingred ient 识别等任务上取得了进展,但在营养估计方面的进展受限于缺乏带有营养标注的数据集。为此,我们引入 FastFood,一个包含 84,446 张图片、覆盖 908 类快速食物类别的数据集, featuring ingredient 和 nutritional 标注。此外,我们提出了一种新的 model-agnostic Visual-Ingredient Feature Fusion (VIF2^2) 方法,通过整合视觉和 ingred ient 特征来增强营养估计。通过在训练期间对 ingred ient 进行同义替换和重抽样策略来提高 ingred ient 的鲁棒性。ingred ient-aware 视觉特征融合模块将 ingred ient 特征和视觉表征结合,以实现准确的营养预测。在测试期间,通过数据增强和多数投票来细化 ingred ient 预测。我们在 FastFood 和 Nutrition5k 数据集上进行的实验验证了该方法在不同 backbone (如 Resnet、InceptionV3 和 ViT) 中的有效性,表明 ingred ient 信息在营养估计中的重要性。https://huiyanqi.github.io/fastfood-nutrition-estimation/

关键词

引用

@article{arxiv.2505.08747,
  title  = {Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion},
  author = {Huiyan Qi and Bin Zhu and Chong-Wah Ngo and Jingjing Chen and Ee-Peng Lim},
  journal= {arXiv preprint arXiv:2505.08747},
  year   = {2025}
}

备注

Accepted for publication in ACM International Conference on Multimedia Retrieval 2025