中文

SAGHOG:用于笔迹检索的 HOG 特征生成自监督自编码器

计算机视觉与模式识别 2024-04-29 v1

摘要

本文介绍了 SAGHOG,一种使用二值化输入图像的 HOG 特征进行笔迹检索的自监督预训练策略。我们的预处理过程应用 Segment Anything 技术从各种数据集中提取手写笔迹,最终获得约 24k 份文档,随后训练一个视觉 Transformer 来重建笔迹的掩码块。然后,通过将 NetRVLAD 作为编码层附加到预训练编码器上,对 SAGHOG 进行微调。我们在三个历史数据集 Historical-WI、HisFrag20 和 GRK-Papyri 上评估了该方法,证明了 SAGHOG 在笔迹检索中的有效性。此外,我们还对该架构进行了消融研究,并评估了无监督和有监督微调。值得注意的是,在 HisFrag20 上,SAGHOG 以 57.2% 的 mAP 超越了相关工作——比当前 SOTA 高出 11.6%,展示了其在具有挑战性的数据上的鲁棒性,并且在小型数据集(例如 GRK-Papyri)上也具有竞争力,我们在该数据集上实现了 58.0% 的 Top-1 准确率。

关键词

引用

@article{arxiv.2404.17221,
  title  = {SAGHOG: Self-Supervised Autoencoder for Generating HOG Features for Writer Retrieval},
  author = {Marco Peer and Florian Kleber and Robert Sablatnig},
  journal= {arXiv preprint arXiv:2404.17221},
  year   = {2024}
}

备注

accepted for ICDAR2024