中文

NutriBench:大型语言模型从餐食描述估算营养数据的基准测试集

计算与语言 2026-03-04 v6 人工智能

摘要

准确的营养估算有助于人们作出知情的饮食选择,是预防严重健康并发症的关键。我们提出NutriBench——首个公开可用的自然语言餐食描述营养基准测试集。NutriBench包含11,857个来自真实全球饮食摄入数据的餐食描述,数据经人工核查并标注了宏量营养素标签,包括碳水化合物、蛋白质、脂肪和热量。我们对NutriBench上的碳水化合物估算任务进行了广泛评估,测试了包括GPT-4o、Llama3.1、Qwen2、Gemma2和OpenBioLLM等十二个主流大型语言模型(LLM),使用标准方法、链式思考和检索增强生成策略。此外,我们组织了专业营养师研究,发现LLM能够提供与之相当但显著更快的估算。最后,我们通过模拟碳水化合物预测对糖尿病患者血糖水平的影响进行了现实风险评估。我们的工作凸显了使用LLM进行营养估算的机遇与挑战,展示了其辅助专业人员和普通用户并改善健康结果的潜力。该基准测试已公开于:https://mehak126.github.io/nutribench.html

关键词

引用

@article{arxiv.2407.12843,
  title  = {NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions},
  author = {Andong Hua and Mehak Preet Dhaliwal and Laya Pullela and Ryan Burke and Yao Qin},
  journal= {arXiv preprint arXiv:2407.12843},
  year   = {2026}
}

备注

ICLR 2025