中文

研究大规模预训练对从 2D 图像估计营养成分的影响

计算机视觉与模式识别 2026-01-16 v2

摘要

从图像中估计食物的营养成分是一项关键任务,对健康和饮食监测具有重要意义。由于食物呈现方式、光照的多变性,以及在缺乏深度信息时推断体积和质量的固有困难,仅依赖 2D 图像进行估计极具挑战性。此外,由于最先进的方法依赖专有数据集进行大规模预训练,该领域的可重复性受到阻碍。在本文中,我们研究了大规模预训练数据集对仅使用 2D 图像进行营养估计的深度学习模型性能的影响。我们在两个大型公开数据集 ImageNet 和 COYO 上对预训练的 Vision Transformer (ViT) 模型进行微调和评估,将其性能与基线 CNN 模型(InceptionV2 和 ResNet-50)以及在专有 JFT-300M 数据集上预训练的最先进方法进行比较。我们在 Nutrition5k 数据集上进行了广泛实验,这是一个包含高精度营养标注的真实世界食物餐盘的大规模集合。我们使用平均绝对误差(MAE)和平均绝对百分比误差(MAE%)进行的评估表明,在 JFT-300M 上预训练的模型显著优于在公开数据集上预训练的模型。出乎意料的是,对于这一特定的回归任务,在庞大的 COYO 数据集上预训练的模型表现不如在 ImageNet 上预训练的模型,这推翻了我们的初始假设。我们的分析提供了定量证据,突显了预训练数据集特征(包括规模、领域相关性和数据整理质量)在 2D 营养估计有效迁移学习中的关键作用。

关键词

引用

@article{arxiv.2508.03996,
  title  = {Investigating the Impact of Large-Scale Pre-training on Nutritional Content Estimation from 2D Images},
  author = {Michele Andrade and Guilherme A. L. Silva and Valéria Santos and Gladston Moreira and Eduardo Luz},
  journal= {arXiv preprint arXiv:2508.03996},
  year   = {2026}
}

备注

12 pages