FoodCHA:面向粗粒度食物分析的多模态 LLM 智能体
人工智能
2026-05-08 v1
摘要
摄像头装配的移动设备和可穿戴设备的广泛采用,使得便捷捕获餐食图像成为可能,使食物识别成为实时饮食监测的关键组件。然而,真实世界的食物图像面临高内类相似性和频繁存在多个食物物品的挑战。虽然深度学习模型在粗粒度分类方面取得了强大的性能,但往往难以捕获烹饪风格等细粒度属性。此外,现代视觉语言模型的开放式生成可能会产生非规范标签,限制了其实际部署。我们提出FoodCHA,这是一个多模态智能体框架,将食物识别重新定义为分层决策过程。通过逐步锚定预测,FoodCHA 使用高层次类别引导子类别识别,并使用子类别引导烹饪风格识别,提高了语义一致性和属性层次的辨识能力。为确保实际可部署性,FoodCHA 利用紧凑型的 Moondream-2B 视觉语言模型,该模型在保持较低计算和内存开销的同时提供了强大的推理能力。在 FoodNExTDB 上的实验表明,FoodCHA 在类别识别和子类别识别精度上分别超过 Food-Llama-3.2-11B 13.8% 和 38.2%,在烹饪风格分类精度上实现了惊人的 153.2% 的提升。
关键词
引用
@article{arxiv.2605.05499,
title = {FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis},
author = {Woojin Lee and Pranav Mekkoth and Ye Tian and Onat Gungor and Tajana Rosing},
journal= {arXiv preprint arXiv:2605.05499},
year = {2026}
}