理解食物分割中的 Image2Video 域迁移问题:对苹果的实例级分析
计算机视觉与模式识别
2026-02-11 v2 机器学习
摘要
在基准数据集上训练的静态图像食物分割模型已取得强大的性能;然而,它们在视频设置中的可靠性仍不被充分理解。在现实应用中,如食物监控和实例计数,分割输出必须在时间上保持一致,但仅基于图像训练的模型往往在部署到视频时会出现崩溃。本文从实例分割和跟踪的角度分析了这一现象,聚焦于苹果作为代表性食物类别。模型仅在图像级食物分割数据上进行训练,在使用基于实例分割跟踪-匹配框架评估视频序列时,实现了对象级别的时序分析。我们的结果表明,高帧级分割准确率并不等于在时间上保持稳定的实例身份。特别是照明变化、光斑反射和纹理模糊导致遮罩闪烁和身份碎片化,造成苹果计数的显著误差。这些失效情况在传统基于图像的指标下被大大低估了实际视频性能。除了诊断问题外,我们还检查了不要求完整视频监督的实用补救措施,包括后处理时序正则化和自监督时序一致性目标。我们的发现表明,问题的根源在于忽略时序一致性的图像中心训练目标,而非模型容量。本研究突显了食物分割研究中的关键评估缺口,动机时序感知的学习和评估协议用于基于视频的食物分析。
引用
@article{arxiv.2602.08491,
title = {Understanding Image2Video Domain Shift in Food Segmentation: An Instance-level Analysis on Apples},
author = {Keonvin Park and Aditya Pal and Jin Hong Mok},
journal= {arXiv preprint arXiv:2602.08491},
year = {2026}
}