用视觉 Transformer 重新思考烹饪状态识别
计算机视觉与模式识别
2023-03-07 v2
摘要
为确保厨房环境的恰当知识表示,厨房机器人识别所烹饪食材的状态至关重要。尽管物体检测与识别领域已被广泛研究,物体状态分类任务仍相对未被充分探索。烹饪不同状态下食材的高类内相似性使该任务更具挑战。研究者近期提出采用基于深度学习的策略,然而尚未取得高性能。本研究利用视觉 Transformer(ViT)架构的自注意力机制处理烹饪状态识别任务。所提方法封装图像的全局显著特征,同时利用从更大数据集学到的权重。这种全局注意力使模型能抵御不同烹饪物体样本间的相似性,而迁移学习的运用借助预训练权重克服了归纳偏置的缺乏。为提升识别准确率,还采用了多种增强技术。在‘烹饪状态识别挑战数据集’上对我们框架的评估取得了 94.3% 的准确率,显著优于当前最优方法。
引用
@article{arxiv.2212.08586,
title = {Rethinking Cooking State Recognition with Vision Transformers},
author = {Akib Mohammed Khan and Alif Ashrafee and Reeshoon Sayera and Shahriar Ivan and Sabbir Ahmed},
journal= {arXiv preprint arXiv:2212.08586},
year = {2023}
}
备注
Accepted in 25th ICCIT (6 pages, 5 Figures, 5 Tables)