中文

一种大规模食物图像分割基准

计算机视觉与模式识别 2021-05-13 v1 多媒体

摘要

食物图像分割是开发健康相关应用(如估算食物热量与营养素)的关键且不可或缺的任务。现有食物图像分割模型表现不佳有两个原因:(1)缺乏带有细粒度食材标签和像素级位置掩码的高质量食物图像数据集——现有数据集要么带有粗粒度食材标签,要么规模较小;(2)食物复杂的外观使其难以在食物图像中定位与识别食材,例如食材可能在同一图像中相互重叠,且同一食材在不同食物图像中外观可能明显不同。本工作中,我们构建了包含 9,490 张图像的新食物图像数据集 FoodSeg103(及其扩展集 FoodSeg154)。我们用 154 个食材类别标注这些图像,每张图像平均有 6 个食材标签和像素级掩码。此外,我们提出一种称为 ReLeM 的多模态预训练方法,显式地为分割模型装备丰富且语义化的食物知识。实验中,我们使用三种流行的语义分割方法(即基于空洞卷积、基于特征金字塔和基于 Vision Transformer 的方法)作为基线,并在我们的新数据集上评估它们以及 ReLeM。我们相信 FoodSeg103(及其扩展集 FoodSeg154)和使用 ReLeM 预训练的模型可作为基准以促进未来细粒度食物图像理解的工作。我们在 \url{https://xiongweiwu.github.io/foodseg103.html} 公开了所有这些数据集与方法。

关键词

引用

@article{arxiv.2105.05409,
  title  = {A Large-Scale Benchmark for Food Image Segmentation},
  author = {Xiongwei Wu and Xin Fu and Ying Liu and Ee-Peng Lim and Steven C. H. Hoi and Qianru Sun},
  journal= {arXiv preprint arXiv:2105.05409},
  year   = {2021}
}

备注

16 pages