中文

面向视觉食物识别的长尾持续学习

计算机视觉与模式识别 2025-04-29 v2

摘要

基于深度学习的食物识别在从进餐场景图像中预测食物类型方面已取得显著进展。然而,两个关键挑战阻碍了现实世界的部署:(1)持续学习新食物类别而不遗忘先前学到的类别;(2)处理食物图像的长尾分布,即少数常见类别与大量稀有类别并存。为应对这些挑战,食物识别方法应聚焦于长尾持续学习。本工作中,我们引入了一个包含186种美国食物及全面标注的数据集。我们还引入了三个新的基准数据集——VFN186-LT、VFN186-INSULIN和VFN186-T2D,它们分别反映了健康人群、胰岛素使用者以及未使用胰岛素的2型糖尿病患者的真实世界食物消费情况。我们提出了一种新颖的端到端框架,利用基于知识蒸馏的预测器来避免持续学习过程中表征的错位,从而提升实例稀有食物类别的泛化能力。此外,我们通过将类激活图(CAM)与CutMix相集成引入了一种增强技术,以改善对实例稀有食物类别的泛化。我们的方法在Food101-LT、VFN-LT、VFN186-LT、VFN186-INSULIN和VFN186-T2DM上进行了评估,显示出相对于现有方法的显著改进。消融研究进一步凸显了性能提升,证明了其在真实世界食物识别应用中的潜力。

关键词

引用

@article{arxiv.2307.00183,
  title  = {Long-Tailed Continual Learning For Visual Food Recognition},
  author = {Jiangpeng He and Xiaoyan Zhang and Luotao Lin and Jack Ma and Heather A. Eicher-Miller and Fengqing Zhu},
  journal= {arXiv preprint arXiv:2307.00183},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Multimedia, the VFN186 food image dataset is available at https://github.com/JiangpengHe/VFN186