中文

大型多模态模型在营养分析中的全面评估:基于新基准的上下文元数据丰富化研究

计算机视觉与模式识别 2025-10-07 v2

摘要

大型多模态模型(LMM)日益被用于餐食图像进行营养分析。然而,现有工作主要评估专有模型,如 GPT-4。这使广泛的 LLM 研究鲜有涉足。此外,整合上下文元数据及其与各种推理修饰符的相互作用影响尚未充abase 探索。本研究考察了如何解释从 GPS 坐标派生的上下文元数据(转换为位置/场所类型)、时间戳(转化为餐次/日类型)以及餐食中所含食物项目,从而提升 LMM 在估计关键营养价值(包括热量、宏量营养素如蛋白质、碳水化合物、脂肪以及份量)方面的性能。我们还引入了 ACETADA,一个新的食物图像数据集计划对外公开。该开放数据集提供由营养师核实的营养信息,构成本分析的基础。我们的评估覆盖八个 LMM(四个开源权重模型和四个闭源权重模型),首先确立了上下文元数据集成相较于仅使用图像进行直接提示的优势。我们进一步展示了这种上下文信息的整合如何提升推理修饰符(如 Chain-of-Thought、Multimodal Chain-of-Thought、Scale Hint、Few-Shot 和 Expert Persona)的效果。实证结果表明,智能地整合元数据,当通过直截的提示策略应用时,可显著降低预测营养价值的平均绝对误差(MAE)和平均绝对百分比误差(MAPE)。本工作凸显了面向改进营养分析的上下文感知 LMM 的潜力。

关键词

引用

@article{arxiv.2507.07048,
  title  = {Comprehensive Evaluation of Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata},
  author = {Bruce Coburn and Jiangpeng He and Megan E. Rollo and Satvinder S. Dhaliwal and Deborah A. Kerr and Fengqing Zhu},
  journal= {arXiv preprint arXiv:2507.07048},
  year   = {2025}
}

备注

The extended full version of the accepted paper in 2025 IEEE BHI conference with title: Evaluating Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata. Dataset is available at: https://skynet.ecn.purdue.edu/~coburn6/ACETADA/