FoodLogAthl-218:使用饮食管理应用程序构建真实世界食物图像数据集
计算机视觉与模式识别
2025-12-17 v1 多媒体
摘要
食物图像分类模型是饮食管理应用的关键,因为它们可以减轻手动记录餐食的负担。然而,大多数用于训练此类模型的公开数据集依赖于网络爬取的图像,往往与用户的真实世界餐食照片存在差异。本文我们提出了 FoodLogAthl-218 数据集,该数据集由通过饮食管理应用程序 FoodLog Athl 收集的真实世界餐记录构成。数据集包含 6,925 张跨越 218 个食物类别的图像,总计 14,349 个边界框。每张图像都伴随丰富的元数据,包括餐食日期和时间、匿名用户 ID 以及餐级上下文。与传统数据集不同——后者通过预定义的类别集合指导基于网络的图像收集——本数据集从用户提交的照片开始,随后对其进行标记。这导致类别内的更大多样性、餐食类型的自然频率分布,以及为个人用途而非公开分享而收集的随意、未经筛选的图像。除了 (1) 一个标准分类基准,我们还引入了两个 FoodLog 特定任务:(2) 遵循用户日志时间序列的增量微调协议,以及 (3) 包含多菜品图像的上下文感知分类任务,模型需利用整体餐食上下文来对每道菜进行分类。我们使用大型多模态模型(LMM)对这些任务进行评估。该数据集已公开于 https://huggingface.co/datasets/FoodLog/FoodLogAthl-218。
引用
@article{arxiv.2512.14574,
title = {FoodLogAthl-218: Constructing a Real-World Food Image Dataset Using Dietary Management Applications},
author = {Mitsuki Watanabe and Sosuke Amano and Kiyoharu Aizawa and Yoko Yamakata},
journal= {arXiv preprint arXiv:2512.14574},
year = {2025}
}