中文

借助带噪声的视觉 Transformer 提升食物图像识别性能

计算机视觉与模式识别 2025-03-26 v1 图像与视频处理

摘要

食物图像识别是计算机视觉中具有高变异性和复杂性的挑战性任务。本研究探讨了将带噪声视觉 Transformer (NoisyViT) 的潜力用于提高食物分类性能的可能性。通过引入噪声进入学习过程中,NoisyViT 减少任务复杂度并调整系统的熵,从而实现模型精度的提升。我们在三个基准数据集上对 NoisyViT 进行微调:Food2K (2000 个类别,约100万张图片)、Food-101 (101 个类别,约10万张图片) 和 CNFOOD-241 (241 个类别,约19万张图片)。评估 NoisyViT 在 Food2K、Food-101 和 CNFOOD-241 上的 Top-1 准确率分别达到95%、99.5% 和96.6%,显著优于现有方法。该研究强调了 NoisyViT 在饮食评估、营养监测和医疗保健应用中的潜力,为基于视觉的食物计算领域的未来发展铺平了道路。用于复现 NoisyViT 食物识别的代码已提供,地址为 NoisyViT_Food。

关键词

引用

@article{arxiv.2503.18997,
  title  = {Improving Food Image Recognition with Noisy Vision Transformer},
  author = {Tonmoy Ghosh and Edward Sazonov},
  journal= {arXiv preprint arXiv:2503.18997},
  year   = {2025}
}