中文

NutritionVerse-Direct:探索用于从食物图像进行多任务营养预测的深度神经网络

计算机视觉与模式识别 2024-05-14 v1

摘要

许多老年个体会遇到有效跟踪其饮食摄入的挑战,从而加剧其患上营养相关健康问题的易感性。自我报告方法往往不准确且受显著偏差影响;然而,利用智能预测方法可以自动化并提高这一过程的精确度。最近的工作探索了使用计算机视觉预测系统从食物图像预测营养信息。然而,这些方法往往针对特定情境设计,需要除食物图像外的其他输入,或不提供全面的营养信息。本文旨在通过利用各种神经网络架构直接从其图像预测一餐的营养内容来提高饮食摄入估计的有效性。通过全面实验与评估,我们呈现了 NutritionVerse-Direct,一种利用基于视觉转换器的体系结构,包含三个全连接层,导致五个回归头预测餐食中热量 (kcal)、质量 (g)、蛋白质 (g)、脂肪 (g) 和碳水化合物 (g) 的营养模型。NutritionVerse-Direct 在 NutritionVerse-Real 数据集上的组合平均误差得分为 412.6,比 Inception-ResNet 模型提高了 25.5%,显示其在提高饮食摄入估计精确度方面的潜力。

关键词

引用

@article{arxiv.2405.07814,
  title  = {NutritionVerse-Direct: Exploring Deep Neural Networks for Multitask Nutrition Prediction from Food Images},
  author = {Matthew Keller and Chi-en Amy Tai and Yuhao Chen and Pengcheng Xi and Alexander Wong},
  journal= {arXiv preprint arXiv:2405.07814},
  year   = {2024}
}