中文

用于笔迹检索的自监督视觉Transformer

计算机视觉与模式识别 2024-09-04 v1 机器学习

摘要

虽然基于视觉Transformer(ViT)的方法已在许多领域取得了最先进的性能,但它们尚未成功应用于笔迹检索领域。该领域主要由使用手工制作特征或从卷积神经网络提取特征的方法主导。在这项工作中,我们弥合了这一差距,并提出了一种新颖的方法,该方法从ViT中提取特征并使用VLAD编码对其进行聚合。该模型以自监督方式训练,无需任何标签。我们表明,在笔迹检索的背景下,提取局部前景特征优于使用ViT的类令牌。我们在两个历史文档集合上评估了我们的方法。我们在Historical-WI数据集(83.1% mAP)和HisIR19数据集(95.0% mAP)上设定了新的最先进性能。此外,我们证明了我们的ViT特征提取器可以直接应用于现代数据集,如CVL数据库(98.6% mAP),而无需任何微调。

关键词

引用

@article{arxiv.2409.00751,
  title  = {Self-Supervised Vision Transformers for Writer Retrieval},
  author = {Tim Raven and Arthur Matei and Gernot A. Fink},
  journal= {arXiv preprint arXiv:2409.00751},
  year   = {2024}
}