中文

Transformer比CNN更懂古罗马硬币纹饰吗?

计算机视觉与模式识别 2026-01-15 v1 人工智能 机器学习

摘要

古硬币的自动分析有望帮助研究人员从大量硬币收藏中提取更多历史见解,并帮助收藏家了解他们正在买卖的内容。该领域的近期研究通过使用卷积神经网络(CNN),在识别古硬币上通常描绘的语义元素方面展现出前景。本文首次将最近提出的 Vision Transformer (ViT) 深度学习架构应用于硬币上的语义元素识别任务,采用来自多模态数据(图像和非结构化文本)的完全自动学习。本文总结了该领域的先前研究,讨论了用于古硬币分析的 ViT 和 CNN 模型的训练与实现,并对其性能进行了评估。研究发现,ViT 模型在准确率上优于新训练的 CNN 模型。

关键词

引用

@article{arxiv.2601.09433,
  title  = {Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?},
  author = {David Reid and Ognjen Arandjelovic},
  journal= {arXiv preprint arXiv:2601.09433},
  year   = {2026}
}