视觉语言模型是否准备好进行饮食评估?——探索 AI 驱动食物图像识别的下一个前沿
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
基于食物图像的自动饮食评估仍是一个挑战,需要精确的食物检测、分割和分类。视觉语言模型(VLMs)通过整合视觉和文本推理,提供了新的可能性。在本研究中,我们评估了六种最先进的 VLMs(ChatGPT、Gemini、Claude、Moondream、DeepSeek 和 LLaVA),分析其在不同水平上的食物识别能力。为建立实验框架,我们引入了 FoodNExTDB,一个独特的食物图像数据库,包含 9,263 张专家标注图像,覆盖 10 个类别(如“蛋白质来源”)、62 个子类别(如“禽肉”)和 9 种烹饪方式(如“烤制”)。该数据库总计包含 50k 营养标签,由七位专家手动标注所有图像。我们还提出了一种新评估指标——专家加权召回率(Expert-Weighted Recall, EWR),该指标考虑了标注者之间的变异性。结果显示,闭源模型在识别单一产品图像中食物产品的 EWR 超过 90%。尽管已展现出潜力,但当前的 VLMs 在细粒度食物识别方面面临挑战,特别是在区分烹饪方式的细微差异和视觉上相似的食物项目方面,这限制了其在自动饮食评估中的可靠性。FoodNExTDB 数据库已公开于 https://github.com/AI4Food/FoodNExtDB。
引用
@article{arxiv.2504.06925,
title = {Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition},
author = {Sergio Romero-Tapiador and Ruben Tolosana and Blanca Lacruz-Pleguezuelos and Laura Judith Marcos Zambrano and Guadalupe X. Bazán and Isabel Espinosa-Salinas and Julian Fierrez and Javier Ortega-Garcia and Enrique Carrillo de Santa Pau and Aythami Morales},
journal= {arXiv preprint arXiv:2504.06925},
year = {2026}
}
备注
Accepted at IEEE/CVF Computer Vision and Pattern Recognition Conference workshops 2025 (CVPRw) 10 pages, 4 figures, 2 tables