中文

UMDFood:视觉-语言模型助推食物成分编撰

计算机视觉与模式识别 2023-11-08 v2

摘要

营养信息在精准营养与食品工业中至关重要。当前的食物成分编撰范式依赖费力且依赖经验的方法。然而,这些方法难以跟上动态消费市场,导致营养数据滞后且不完整。此外,早期的机器学习方法忽视了食物成分声明中的信息或忽略了食物图像的特征。为此,我们提出一种新颖的视觉-语言模型 UMDFood-VL,利用包装正面标签与产品图像来准确估算食物成分谱。为赋能模型训练,我们建立了迄今最全面的多模态食物数据库 UMDFood-90k,包含 89,533 个样本,每个样本均标注图像与基于文本的配料描述以及 11 项营养素注释。UMDFood-VL 在脂肪含量估算上 macro-AUCROC 达 0.921,显著高于现有基线方法,并满足食物成分编撰的实际需求。同时,高达 82.2% 的所选产品的化学分析结果与模型估算结果之间的估算误差小于 10%。该性能为面向其他食物与营养相关数据的编撰的泛化能力,以及为其他需要个性化的食物应用中基于生成式 AI 的技术演进提供了启示。

关键词

引用

@article{arxiv.2306.01747,
  title  = {UMDFood: Vision-language models boost food composition compilation},
  author = {Peihua Ma and Yixin Wu and Ning Yu and Yang Zhang and Michael Backes and Qin Wang and Cheng-I Wei},
  journal= {arXiv preprint arXiv:2306.01747},
  year   = {2023}
}

备注

13 pages, 9 figures