基于视觉感知层次结构的食物识别
计算机视觉与模式识别
2020-12-08 v1
摘要
食物识别是基于图像的饮食评估中最重要的组成部分之一。然而,由于食物图像的复杂度不同以及食物类别间的类间相似性,基于图像的食物识别系统难以在多种公开可用数据集上实现高准确率。在本工作中,我们提出了一种新的两步食物识别系统,包括食物定位与使用卷积神经网络(CNNs)作为骨干架构的层次化食物分类。食物定位步骤基于 Faster R-CNN 方法的实现来识别食物区域。在食物分类步骤中,视觉相似的食物类别可自动聚类在一起以生成表示食物类别间语义视觉关系的层次结构,随后提出一个多任务 CNN 模型基于该视觉感知层次结构执行分类任务。由于数据集的规模与质量是数据驱动方法的关键组成部分,我们引入了一个新的食物图像数据集 VIPER-FoodNet (VFN) 数据集,包含基于美国最常吃的食物的 82 个食物类别与 15k 张图像。一个半自动众包工具被用于为该数据集提供包括食物对象边界框与食物对象标签的 ground-truth 信息。实验结果表明,我们的系统在 4 个公开可用数据集与新 VFN 数据集上均能显著提升分类与识别性能。
引用
@article{arxiv.2012.03368,
title = {Visual Aware Hierarchy Based Food Recognition},
author = {Runyu Mao and Jiangpeng He and Zeman Shao and Sri Kalyan Yarlagadda and Fengqing Zhu},
journal= {arXiv preprint arXiv:2012.03368},
year = {2020}
}
备注
MADiMA 2020