大规模视觉食物识别
计算机视觉与模式识别
2023-02-28 v3
摘要
食物识别在食物选择与摄入中起着重要作用,这对人类的健康与福祉至关重要。因此它对计算机视觉界具有重要意义,并可进一步支撑许多面向食物的视觉与多模态任务。遗憾的是,我们已见证了发布的大规模数据集在通用视觉识别方面取得显著进展,而在食物领域却大大滞后。本文引入 Food2K,这是最大的食物识别数据集,包含 2000 个类别和超过 100 万张图像。与现有食物识别数据集相比,Food2K 在类别和图像数量上均超出一个数量级,从而建立了一个具有挑战性的新基准,用于开发先进的食物视觉表征学习模型。此外,我们提出了一种用于食物识别的深度渐进区域增强网络,主要由两个组件构成,即渐进局部特征学习和区域特征增强。前者采用改进的渐进训练来学习多样且互补的局部特征,而后者利用自注意力将多尺度的更丰富上下文融入局部特征以进一步增强局部特征。在 Food2K 上的大量实验证明了我们所提方法的有效性。更重要的是,我们验证了 Food2K 在多种任务中的更好泛化能力,包括食物识别、食物图像检索、跨模态菜谱检索、食物检测与分割。Food2K 可进一步探索以惠及更多食物相关任务,包括新兴且更复杂的任务(例如食物营养理解),且在 Food2K 上训练的模型有望作为骨干网络提升更多食物相关任务的性能。我们也希望 Food2K 能作为大规模细粒度视觉识别基准。
引用
@article{arxiv.2103.16107,
title = {Large Scale Visual Food Recognition},
author = {Weiqing Min and Zhiling Wang and Yuxin Liu and Mengjiang Luo and Liping Kang and Xiaoming Wei and Xiaolin Wei and Shuqiang Jiang},
journal= {arXiv preprint arXiv:2103.16107},
year = {2023}
}
备注
Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence