借助带噪声的视觉 Transformer 提升食物图像识别性能
计算机视觉与模式识别
2025-03-26 v1 图像与视频处理
摘要
食物图像识别是计算机视觉中具有高变异性和复杂性的挑战性任务。本研究探讨了将带噪声视觉 Transformer (NoisyViT) 的潜力用于提高食物分类性能的可能性。通过引入噪声进入学习过程中,NoisyViT 减少任务复杂度并调整系统的熵,从而实现模型精度的提升。我们在三个基准数据集上对 NoisyViT 进行微调:Food2K (2000 个类别,约100万张图片)、Food-101 (101 个类别,约10万张图片) 和 CNFOOD-241 (241 个类别,约19万张图片)。评估 NoisyViT 在 Food2K、Food-101 和 CNFOOD-241 上的 Top-1 准确率分别达到95%、99.5% 和96.6%,显著优于现有方法。该研究强调了 NoisyViT 在饮食评估、营养监测和医疗保健应用中的潜力,为基于视觉的食物计算领域的未来发展铺平了道路。用于复现 NoisyViT 食物识别的代码已提供,地址为 NoisyViT_Food。
引用
@article{arxiv.2503.18997,
title = {Improving Food Image Recognition with Noisy Vision Transformer},
author = {Tonmoy Ghosh and Edward Sazonov},
journal= {arXiv preprint arXiv:2503.18997},
year = {2025}
}