中文

OVFoodSeg:通过图像引导的文本表示提升开放词汇食品图像分割

计算机视觉与模式识别 2024-04-03 v1 人工智能 多媒体

摘要

在食品计算领域,从图像中分割食材面临着重大挑战,包括同一食材的类内差异大、新食材的出现以及大型食品分割数据集的高标注成本。现有方法主要采用封闭词汇和静态文本嵌入设置。这些方法在处理食材,特别是新的和多样化的食材时往往效果不佳。针对这些限制,我们引入了OVFoodSeg,一个采用开放词汇设置并通过视觉上下文增强文本嵌入的框架。通过集成视觉语言模型(VLM),我们的方法通过两个创新模块(即图像到文本学习器FoodLearner和图像引导文本编码器)用图像特定信息丰富文本嵌入。OVFoodSeg的训练过程分为两个阶段:FoodLearner的预训练和后续的分割学习阶段。预训练阶段使FoodLearner具备将视觉信息与食品相关的相应文本表示对齐的能力,而第二阶段则使FoodLearner和图像引导文本编码器适应分割任务。通过弥补先前模型的不足,OVFoodSeg展示了显著的改进,在FoodSeg103数据集上平均交并比(mIoU)提高了4.9%,为食品图像分割树立了新的里程碑。

关键词

引用

@article{arxiv.2404.01409,
  title  = {OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation},
  author = {Xiongwei Wu and Sicheng Yu and Ee-Peng Lim and Chong-Wah Ngo},
  journal= {arXiv preprint arXiv:2404.01409},
  year   = {2024}
}

备注

CVPR 2024; 12 pages