中文

使用多模态 ChatGPT 进行饮食评估:系统性分析

计算机视觉与模式识别 2023-12-15 v1

摘要

传统的饮食评估方法主要基于自我报告或由营养师监督的结构化访谈。然而,这些方法通常具有主观性、可能不准确且耗时。尽管已设计出基于人工智能(AI)的解决方案以自动化饮食评估过程,但这些早期的 AI 方法在跨多种食物类型、饮食行为和文化背景的泛化能力上面临挑战。这导致饮食领域的 AI 应用具有狭窄的专业性和有限的准确性。最近,诸如支持最新 ChatGPT 的 GPT-4V 等多模态基础模型的出现,在众多研究领域的广泛任务(例如场景理解和图像描述)中展现出变革性潜力。这些模型表现出卓越的通用智能和准确性,能够处理多种数据模态。在本研究中,我们探讨了多模态 ChatGPT 在饮食评估领域的应用。我们的研究结果表明,GPT-4V 在具有挑战性的条件下表现出色,在未使用特定食物数据集进行任何微调或适配的情况下,食物检测准确率高达 87.5%。通过使用特定语言提示(例如非洲美食)引导模型,它能从识别米饭和面包等常见主食转变为准确识别 banku 和 ugali 等地区性菜肴。GPT-4V 的另一突出特点是其上下文感知能力。GPT-4V 能够利用周围物体作为尺度参考来推断食物的份量,进一步提高了其将食物重量转化为营养成分的准确性。这种与美国农业部国家营养数据库的一致性,突显了 GPT-4V 在推动营养科学和饮食评估技术方面的潜力。

关键词

引用

@article{arxiv.2312.08592,
  title  = {Dietary Assessment with Multimodal ChatGPT: A Systematic Analysis},
  author = {Frank P. -W. Lo and Jianing Qiu and Zeyu Wang and Junhong Chen and Bo Xiao and Wu Yuan and Stamatia Giannarou and Gary Frost and Benny Lo},
  journal= {arXiv preprint arXiv:2312.08592},
  year   = {2023}
}

备注

10 pages