CaLoRAify:基于视觉-文本配对和LoRA驱动的视觉语言模型热量估计
计算机视觉与模式识别
2024-12-16 v1
摘要
肥胖现象,称为重大问题,是全球可预防慢性病的主要原因。传统的热量估计工具常依赖特定数据格式或复杂流程,限制了其在实际场景中的实用性。最近,视觉语言模型(VLM)在理解真实场景和实现对话交互方面表现出色,成为食材分析等下游任务的理想选择。然而,将VLM应用于热量估计需要特定的领域数据和对齐策略。为此,我们构建了CalData数据集,包含33万张图像-文本对,专为食材识别和热量估计而设计,结合大规模食谱数据集与详细营养指示,进行稳健的视觉-语言训练。基于该数据集,我们提出了CaLoRAify,一种新型VLM框架,通过视觉-文本配对训练实现食材识别与热量估计的对齐。在推理阶段,用户只需输入单张单目食物图像即可进行热量估计,同时保留基于智能体的对话交互灵活性。通过低秩适应(LoRA)和检索增强生成(RAG)技术,我们的系统提升了基础VLM在热量估计垂直领域的性能。我们的代码和数据已完全开源于https://github.com/KennyYao2001/16824-CaLORAify。
关键词
引用
@article{arxiv.2412.09936,
title = {CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models},
author = {Dongyu Yao and Keling Yao and Junhong Zhou and Yinghao Zhang},
journal= {arXiv preprint arXiv:2412.09936},
year = {2024}
}
备注
Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement