利用 Transformers 与卷积迁移知识用于食物图像分割
计算机视觉与模式识别
2023-06-16 v1
摘要
食物图像分割是一项具有重要应用(如估算一盘食物的营养价值)的普遍任务。尽管机器学习模型已用于该领域的分割,食物图像仍带来若干挑战。一个挑战是食物条目可能重叠与混合,难以区分。另一挑战是类间相似度高与类内差异大,这由食物条目不同的制备方式与所用餐具引起。此外,类别不平衡是食物数据集中不可避免的问题。为应对这些问题,我们训练并比较了两个模型,一个基于卷积神经网络,另一个基于双向图像 Transformer 编码器表示(BEiT)。模型使用 FoodSeg103 数据集进行训练与评估,该数据集被认定为食物图像分割的稳健基准。BEiT 模型以在 FoodSeg103 上 49.4 的平均交并比超越了先前的 SOTA 模型。本研究为在食物图像领域利用卷积与基于 Transformer 的方法迁移知识提供了见解。
引用
@article{arxiv.2306.09203,
title = {Transferring Knowledge for Food Image Segmentation using Transformers and Convolutions},
author = {Grant Sinha and Krish Parmar and Hilda Azimi and Amy Tai and Yuhao Chen and Alexander Wong and Pengcheng Xi},
journal= {arXiv preprint arXiv:2306.09203},
year = {2023}
}