中文

基于食物图像的自监督视觉表征学习

计算机视觉与模式识别 2023-03-17 v1 图像与视频处理

摘要

食物图像分析是基于图像的饮食评估的基础,该过程利用所拍摄的食物或用餐场景图像监测所消耗食物的种类与能量多少。现有基于深度学习的方法基于每幅食物图像的人工标注来学习下游任务的视觉表征。然而,现实生活中的大多数食物图像是无标签获取的,且数据标注需要大量时间与人力,对实际应用不可行。为利用海量无标签图像,许多现有工作聚焦于直接从无标签数据中进行无监督或自监督的视觉表征学习。然而,这些现有工作均未聚焦于食物图像,因其类间相似度高、类内差异大而比通用物体更具挑战性。本文中,我们聚焦于现有代表性自监督学习方法在食物图像上的实现与分析。具体而言,我们首先在Food-101数据集上比较六种选定自监督学习模型的性能。随后我们分析各选定模型在食物数据上训练时的优劣,以识别有助于提升性能的关键因素。最后,我们提出若干面向食物图像自监督视觉表征学习的未来工作设想。

关键词

引用

@article{arxiv.2303.09046,
  title  = {Self-Supervised Visual Representation Learning on Food Images},
  author = {Andrew Peng and Jiangpeng He and Fengqing Zhu},
  journal= {arXiv preprint arXiv:2303.09046},
  year   = {2023}
}

备注

Presented and published in EI 2023 Conference Proceedings