VISTA:由 U-Net 与图像色彩丰富度帧过滤增强的 Vision Transformer 用于自动零售结账
计算机视觉与模式识别
2022-04-26 v1
摘要
多类别商品计数与识别从图像或视频中识别商品项以实现自动零售结账。由于现实场景中存在商品项重叠的遮挡、传送带上的快速移动、被扫描商品整体外观的高度相似性、新商品以及误识别的负面影响,该任务具有挑战性。此外,训练集与测试集之间存在域偏差,具体而言,所提供的训练数据集由合成图像组成,而测试集视频包含手和托盘等外来物体。为解决上述这些问题,我们提出对视频序列中的各帧进行分割与分类。分割方法由统一的单商品项与手分割以及随后的熵掩码组成,以解决域偏差问题。多类别分类方法基于 Vision Transformers(ViT)。为识别含目标物体的帧,我们利用若干图像处理方法并提出了一种自定义度量以丢弃不含任何商品项的帧。结合所有这些机制,我们的最佳系统在 AI City Challenge 2022 Track 4 中取得第 3 名,F1 分数为 0.4545。代码将发布于
引用
@article{arxiv.2204.11024,
title = {VISTA: Vision Transformer enhanced by U-Net and Image Colorfulness Frame Filtration for Automatic Retail Checkout},
author = {Md. Istiak Hossain Shihab and Nazia Tasnim and Hasib Zunair and Labiba Kanij Rupty and Nabeel Mohammed},
journal= {arXiv preprint arXiv:2204.11024},
year = {2022}
}
备注
accepted at AI City Challenge workshop - CVPR 2022