中文

FoodMem:近实时精准食物视频分割

计算机视觉与模式识别 2025-02-11 v2

摘要

食物分割(包括视频中的分割)对于解决现实世界的健康、农业和食物生物技术问题至关重要。当前的局限性导致营养分析不准确、作物管理低效以及食物加工次优,影响食物安全和公共卫生。改进分割技术可以增强饮食评估、农业生产力和食物生产过程。本研究介绍了开发用于高质量、近实时分割和跟踪视频中食物项目的强大框架的开发,使用最小硬件资源。我们 presented FoodMem,一个旨在从360度无限场景视频序列中分割食物项目的新型框架。FoodMem 能够持续生成视频序列中食物portion的掩码,克服现有语义分割模型的局限性,如视频处理上下文中的闪烁和推不住的推断速度。为解决这些问题,FoodMem 采用两种阶段的解决方案:采用变换器分割阶段创建初始分割掩码,采用基于记忆的跟踪阶段在复杂场景中监视食物掩码。我们的框架在各种条件下均超越当前最先进的食物分割模型,包括摄像机角度、照明、反射、场景复杂性和食物多样性。结果导致分割噪声减少、消除制造物,并完成缺失的分割。本文还引入了一个新的标注食物数据集,涵盖以前基准测试中不存在的具有挑战性的情景。在 MetaFood3D、Nutrition5k 和蔬菜与水果 数据集上进行的大量实验表明,FoodMem 在食物视频分割中将最先进技术提升了 2.5% 的平均精度,并平均快 58 倍。

关键词

引用

@article{arxiv.2407.12121,
  title  = {FoodMem: Near Real-time and Precise Food Video Segmentation},
  author = {Ahmad AlMughrabi and Adrián Galán and Ricardo Marques and Petia Radeva},
  journal= {arXiv preprint arXiv:2407.12121},
  year   = {2025}
}