基于隐式尺度的三维重建用于单目多食物体积估计
计算机视觉与模式识别
2026-02-16 v1
摘要
我们提出了从单目多食物图像进行隐式尺度三维重建(Implicit-Scale 3D Reconstruction from Monocular Multi-Food Images),一个旨在现实用餐场景下几何化食物份量估计的基准数据集。现有饮食评估方法主要依赖单图像分析或基于外观的推断,包括最近的视觉-语言模型,这些方法缺乏显式几何推理且对尺度模糊敏感。该基准将食物份量估计重新定义为在单目观测下的隐式尺度三维重建问题。为反映真实场景,显式物理参考和度量标注被移除;相反,提供上下文对象(如盘子、刀叉等),要求算法从隐式线索和先验知识推断尺度。数据集强调多食物场景,包含多样化的物体几何、频繁的遮挡和复杂的空间布局。该基准被采纳为 MetaFood 2025 工作坊的挑战赛,多个团队提出了基于重建的方法。实验结果表明,虽然强大的视觉-语言基线在性能上具有竞争力,但几何化重建方法在准确率和鲁棒性方面都有所提升,其中顶尖方法在体积估计中实现了 0.21 的 MAPE,在几何精度上实现了 5.7 的 L1 Chamfer Distance。
引用
@article{arxiv.2602.13041,
title = {Implicit-Scale 3D Reconstruction for Multi-Food Volume Estimation from Monocular Images},
author = {Yuhao Chen and Gautham Vinod and Siddeshwar Raghavan and Talha Ibn Mahmud and Bruce Coburn and Jinge Ma and Fengqing Zhu and Jiangpeng He},
journal= {arXiv preprint arXiv:2602.13041},
year = {2026}
}
备注
Paper accepted to 2026 IEEE Southwest Symposium on Image Analysis and Interpretation. The dataset can be downloaded at: https://www.kaggle.com/competitions/3d-reconstruction-from-monocular-multi-food-images/data