评估 Gemini LLM 在基于食物图像的食谱与营养描述中的表现:基于 EfficientNet-B4 视觉主干
计算机视觉与模式识别
2025-11-14 v1 机器学习
摘要
数字食物应用的不断增长 necessitates robust methods for automated nutritional analysis and culinary guidance. 本文提出一种解耦的多模态管道用于 food recognition 的全面比较评估。我们评估了一个集成专用视觉主干 (EfficientNet-B4) 与强大生成式大语言模型 (Google Gemini LLM) 的系统。核心目标是评估视觉分类准确率、模型效率与生成输出质量 (营养数据和食谱) 之间的 trade-offs。我们将该管道基准测试于替代视觉主干 (VGG-16, ResNet-50, YOLOv8) 和轻量级 LLM (Gemma) 上。我们引入一种形式化的语义误差传播 (Semantic Error Propagation, SEP) 来分析视觉模块的分类不准确如何级联到生成输出中。我们的分析基于一个新的 Custom Chinese Food Dataset (CCFD) 开发, 以解决公开数据集中的文化偏见。实验结果表明, 虽然 EfficientNet-B4 (89.0% Top-1 Acc.) 在准确率与效率之间提供了最佳平衡, 而 Gemini (9.2/10 Factual Accuracy) 提供了优越的生成质量, 但该系统的整体实用性 fundamentally 受限于视觉前端的感知准确率。我们进行详细的 per-class 分析, 指出高语义相似性是最关键的失败模式。
引用
@article{arxiv.2511.08215,
title = {Evaluating Gemini LLM in Food Image-Based Recipe and Nutrition Description with EfficientNet-B4 Visual Backbone},
author = {Rizal Khoirul Anam},
journal= {arXiv preprint arXiv:2511.08215},
year = {2025}
}