中文

基于编码器 - 解码器模型的珠宝识别

计算机视觉与模式识别 2024-04-03 v1 人工智能

摘要

由于配饰风格和设计的多样性,珠宝识别是一项复杂的任务。对各种配饰进行精确描述目前只能由珠宝领域的专家完成。在这项工作中,我们提出了一种利用计算机视觉技术和图像描述生成进行珠宝识别的方法,试图模拟专家分析配饰的人类行为。所提出的方法包括使用不同的图像描述生成模型从图像中检测珠宝并生成配饰的自然语言描述。随后,该描述也被用于在不同细节层次上对配饰进行分类。生成的描述包含珠宝类型、颜色、材质和设计等细节。为了证明所提方法在准确识别不同类型珠宝方面的有效性,我们创建了一个由西班牙科尔多瓦 (C\'ordoba) 珠宝店的配饰图像组成的数据集。在测试了不同的图像描述生成架构后,最终模型的描述生成准确率达到 95%。所提出的方法具有应用于珠宝电子商务、库存管理或自动珠宝识别以分析人们品味和社会地位等多种应用的潜力。

关键词

引用

@article{arxiv.2401.08003,
  title  = {Jewelry Recognition via Encoder-Decoder Models},
  author = {José M. Alcalde-Llergo and Enrique Yeguas-Bolívar and Andrea Zingoni and Alejandro Fuerte-Jurado},
  journal= {arXiv preprint arXiv:2401.08003},
  year   = {2024}
}

备注

6 pages, 5 figures, MetroXRAINE 2023 Conference