通过三维物体缩放进行食物份量估计
计算机视觉与模式识别
2024-10-14 v2 人工智能
机器学习
多媒体
图像与视频处理
摘要
基于图像的食物图像分析方法减轻了传统方法带来的用户负担和偏差。然而,由于智能手机摄像头或可穿戴设备捕获的食物二维表示丢失了三维信息,准确的份量估计仍然是一个主要挑战。本文提出了一种新框架,通过利用三维食物模型和进食场景中的物理参考,从二维图像估计食物体积和能量。我们的方法估计输入图像中相机和食物物体的姿态,并通过使用估计的姿态渲染食物三维模型的图像来重建进食场景。我们还引入了一个新数据集 SimpleFood45,其中包含 45 种食品的二维图像以及相关的标注信息,包括食物体积、重量和能量。我们的方法在该数据集上实现了平均误差 31.10 kCal(17.67%),优于现有的份量估计方法。数据集可访问:https://lorenz.ecn.purdue.edu/~gvinod/simplefood45/,代码可访问:https://gitlab.com/viper-purdue/monocular-food-volume-3d。
引用
@article{arxiv.2404.12257,
title = {Food Portion Estimation via 3D Object Scaling},
author = {Gautham Vinod and Jiangpeng He and Zeman Shao and Fengqing Zhu},
journal= {arXiv preprint arXiv:2404.12257},
year = {2024}
}