DietDelta: 基于前后对比图像的视觉语言方法进行膳食评估
计算机视觉与模式识别
2026-04-09 v1 人工智能
多媒体
图像与视频处理
摘要
准确的膳食评估对精准营养至关重要,但大多数基于图像的方法仅依赖单张摄入前图像,且仅提供粗略的餐级估计。这些方法无法确定实际摄入了什么食物,且通常需要深度感知、多视角图像或显式分割等限制性输入。在本文中,我们提出了一种简单的视觉语言框架,利用前后配对进食图像进行食物项目级的营养分析。我们的方法不依赖刚性分割掩码,而是利用自然语言提示来定位特定食物项目,并从单张RGB图像直接估计其重量。我们进一步通过两阶段训练策略预测配对图像之间的重量差异来估计食物消耗。我们在三个公开数据集上评估了所提方法,并展示了相对于现有方法的一致性提升,为前后对比膳食图像分析建立了强有力的基准。
引用
@article{arxiv.2604.06352,
title = {DietDelta: A Vision-Language Approach for Dietary Assessment via Before-and-After Images},
author = {Gautham Vinod and Siddeshwar Raghavan and Bruce Coburn and Fengqing Zhu},
journal= {arXiv preprint arXiv:2604.06352},
year = {2026}
}