中文

BenchSeg:用于多视角食物视频分割的大规模数据集与基准

计算机视觉与模式识别 2026-01-21 v2

摘要

食物图像分割是饮食分析的关键任务,能够准确估计食物体积和营养成分。然而,当前方法受限于有限的多视角数据以及对新视角的泛化能力差。我们引入了BenchSeg,一个新颖的多视角食物视频分割数据集和基准。BenchSeg汇集了55个菜品场景(来自Nutrition5k、Vegetables & Fruits、MetaFood3D和FoodKit),包含25,284个精心标注的帧,在自由360°相机运动下捕捉每个菜品。我们在现有的FoodSeg103数据集上评估了20种不同的最先进分割模型(例如,基于SAM的、Transformer、CNN和大规模多模态模型),并在BenchSeg上对它们(单独以及结合视频记忆模块)进行了评估。定量和定性结果表明,虽然标准图像分割器在新视角下性能急剧下降,但记忆增强方法在帧间保持了时间一致性。我们基于SeTR-MLA+XMem2组合的最佳模型优于先前的工作(例如,比FoodMem提高了约2.63% mAP),为饮食分析中的食物分割和跟踪提供了新的见解。除了逐帧空间精度外,我们引入了一个专门的时间评估协议,通过连续性、闪烁率和IoU漂移指标明确量化了分割随时间的稳定性。这使我们能够揭示在标准逐帧评估下仍然不可见的失败模式。我们发布BenchSeg以促进未来的研究。包含数据集注释和食物分割模型的项目页面可在https://amughrabi.github.io/benchseg找到。

关键词

引用

@article{arxiv.2601.07581,
  title  = {BenchSeg: A Large-Scale Dataset and Benchmark for Multi-View Food Video Segmentation},
  author = {Ahmad AlMughrabi and Guillermo Rivo and Carlos Jiménez-Farfán and Umair Haroon and Farid Al-Areqi and Hyunjun Jung and Benjamin Busam and Ricardo Marques and Petia Radeva},
  journal= {arXiv preprint arXiv:2601.07581},
  year   = {2026}
}