中文

用于单视图膳食评估的部分监督多任务网络

计算机视觉与模式识别 2020-08-04 v1

摘要

食物体积估计是膳食评估流程中的关键步骤,需要精确估计食物表面与桌面的深度。现有基于计算机视觉的方法要么需要多图像输入,要么需要额外的深度图,降低了实现的便捷性与实际意义。尽管近期在无监督单图像深度估计方面取得了进展,但在大面积无纹理区域上的性能仍有待提升。本文提出一种网络架构,可对单张食物图像联合执行几何理解(即深度预测与三维平面估计)与语义预测,从而实现稳健且准确的食物体积估计,而不受目标平面纹理特征的影响。该网络的训练仅需带有语义真值的单目视频,不再需要深度图与三维平面真值。在两个独立食物图像数据库上的实验结果表明,我们的方法在无纹理场景下表现稳健,优于无监督网络与基于运动恢复结构的方法,同时取得了与全监督方法相当的性能。

关键词

引用

@article{arxiv.2008.00818,
  title  = {Partially Supervised Multi-Task Network for Single-View Dietary Assessment},
  author = {Ya Lu and Thomai Stathopoulou and Stavroula Mougiakakou},
  journal= {arXiv preprint arXiv:2008.00818},
  year   = {2020}
}