FoodLMM:基于大型多模态模型的多功能食物助手
计算机视觉与模式识别
2024-04-15 v2
摘要
大型多模态模型 (Large Multi-modal Models, LMMs) 在许多视觉-语言任务中取得了令人瞩目的进展。然而,通用 LMMs 在特定领域的性能仍远不能令人满意。本文提出了 FoodLMM,一种基于 LMMs 的多功能食物助手,具备食物识别、配料识别、食谱生成、营养估计、食物分割和多轮对话等多种能力。为使 FoodLMM 能够处理纯文本输出之外的任务,我们引入了一系列新颖的任务特定 token 和头,使模型能够预测食物营养价值和多个分割掩码。我们采用两阶段训练策略。在第一阶段,我们利用多个公开食物基准,通过指令跟随范式进行多任务学习。在第二阶段,我们构建了一个多轮对话数据集和一个推理分割数据集来微调模型,使其能够在食物领域进行专业对话并基于复杂推理生成分割掩码。我们微调后的 FoodLMM 在多个食物基准上取得了最先进的结果。我们将公开我们的代码、模型和数据集。
引用
@article{arxiv.2312.14991,
title = {FoodLMM: A Versatile Food Assistant using Large Multi-modal Model},
author = {Yuehao Yin and Huiyan Qi and Bin Zhu and Jingjing Chen and Yu-Gang Jiang and Chong-Wah Ngo},
journal= {arXiv preprint arXiv:2312.14991},
year = {2024}
}