中文

用于有效酒标识别的单图像驱动3D视角训练数据增强

计算机视觉与模式识别 2024-04-16 v1 机器学习

摘要

面对复杂图像识别领域训练数据不足的关键挑战,本文介绍了一种专为酒标识别定制的新型3D视角增强技术。该方法通过从单张真实酒标图像生成视觉上逼真的训练样本,克服了由文本和标志的复杂组合所带来的挑战,从而提升了深度学习模型的性能。经典的生成对抗网络方法在合成如此复杂的内容组合方面有所欠缺。我们提出的解决方案利用久经考验的计算机视觉和图像处理策略来扩展我们的训练数据集,从而拓宽了深度学习应用的训练样本范围。这种创新的数据增强方法规避了有限训练资源的限制。通过在Vision Transformer架构上使用增强的训练图像进行批次全三元组度量学习,我们可以为每个酒标获得最具判别力的嵌入特征,使我们能够对训练类别中已有的酒标或训练中不可用的未来新收集的酒标进行单样本识别。实验结果表明,与传统的2D数据增强技术相比,识别准确率有显著提高。

关键词

引用

@article{arxiv.2404.08820,
  title  = {Single-image driven 3d viewpoint training data augmentation for effective wine label recognition},
  author = {Yueh-Cheng Huang and Hsin-Yi Chen and Cheng-Jui Hung and Jen-Hui Chuang and Jenq-Neng Hwang},
  journal= {arXiv preprint arXiv:2404.08820},
  year   = {2024}
}