中文

基于三维主观视角烹饪视频的菜品级营养估计:V-Nutri

计算机视觉与模式识别 2026-04-15 v1

摘要

从视觉数据估计餐食营养是监测饮食和计算健康的重要问题,但现有方法大多依赖于完成菜品的最终单张图像。这种设置在根本上受限,因为许多营养相关的成分(如油脂、酱料)以及烹饪变换,在烹饪后变得在视觉上模糊,导致准确估计热量和宏量营养素的困难。本文我们探讨了从三维主观视角烹饪视频中获取烹饪过程信息是否有助于菜品级营养估计。首先,我们进一步手动标注了HD-EPIC数据集,建立了视频基准的第一个数据集。最重要的是,我们提出了V-Nutri,一个分阶段框架,将Nutrition5K预训练的视觉主干网络与一个轻量级融合模块相结合,该模块聚合来自最终菜品帧和从三维主观视角烹饪视频中提取的烹饪过程关键帧的特征。V-Nutri还包括一个烹饪关键帧选择模块和一个面向ingredient-addition时刻的VideoMamba-based事件检测模型。在HD-EPIC数据集上的实验表明,过程线索可以提供补充的营养证据,提高受控条件下的营养估计准确性。我们的进一步结果表明,过程关键帧的效用在很大程度上取决于主干网络表示容量和事件检测质量。我们的代码和标注数据集可在https://github.com/K624-YCK/V-Nutri获取。

关键词

引用

@article{arxiv.2604.11913,
  title  = {V-Nutri: Dish-Level Nutrition Estimation from Egocentric Cooking Videos},
  author = {Chengkun Yue and Chuanzhi Xu and Jiangpeng He},
  journal= {arXiv preprint arXiv:2604.11913},
  year   = {2026}
}

备注

Accepted to the 3rd MetaFood Workshop at CVPR 2026