中文

MultiFoodChat:面向智能食物质量检测的新范式

计算机视觉与模式识别 2025-10-17 v1

摘要

食物图像分类在智能食物质量检测、饮食评估和自动监控中发挥着重要作用。然而,大多数现有监督模型依赖庞大的标注数据集,并对未见食物类别的泛化能力有限。为克服这些挑战,本研究引入MultiFoodChat——一个面向零样本食物识别的对话驱动多智能体推理框架。该框架集成视觉语言模型(VLM)和大语言模型(LLM),通过多轮视觉-文本对话实现协作推理。Object Perception Token(OPT)捕获细粒度视觉属性,而Interactive Reasoning Agent(IRA)则动态解释语境线索以细化预测。这种多智能体设计允许在无需额外训练或手动标注的情况下,对复杂食物场景进行灵活且类似人类的理解。实验在多个公开食物数据集上进行,结果表明MultiFoodChat在准确率和可解释性方面优于现有无监督和少量样本方法,凸显其作为智能食物质量检测与分析新范式的潜力。

关键词

引用

@article{arxiv.2510.13889,
  title  = {MultiFoodhat: A potential new paradigm for intelligent food quality inspection},
  author = {Yue Hu and Guohang Zhuang},
  journal= {arXiv preprint arXiv:2510.13889},
  year   = {2025}
}