ST-KeyS: 面向历史手写文档关键词 spotting 的自监督 Transformer
计算机视觉与模式识别
2023-03-07 v1
摘要
历史文档中的关键词 spotting(KWS)是初步探索数字化馆藏的重要工具。如今,最高效的 KWS 方法依赖于需要大量标注训练数据的机器学习技术。然而,对于历史手稿,缺乏用于训练的标注语料库。为处理数据稀缺问题,我们研究了自监督学习的优势,以在不依赖人工标注的情况下提取输入数据的有用表示,并将这些表示用于下游任务。我们提出 ST-KeyS,一种基于视觉 Transformer 的掩码自编码器模型,其预训练阶段基于掩码-预测范式,无需标注数据。在微调阶段,预训练编码器被集成到一个连体神经网络模型中,该模型被微调以改进来自输入图像的特征嵌入。我们进一步利用字符金字塔直方图(PHOC)嵌入改进图像表示,以基于文本属性创建并利用图像的中间表示。在三个广泛使用的基准数据集(Botany、Alvermann Konzilsprotokolle 和 George Washington)上的详尽实验评估中,所提方法优于在相同数据集上训练的最先进方法。
引用
@article{arxiv.2303.03127,
title = {ST-KeyS: Self-Supervised Transformer for Keyword Spotting in Historical Handwritten Documents},
author = {Sana Khamekhem Jemni and Sourour Ammar and Mohamed Ali Souibgui and Yousri Kessentini and Abbas Cheddad},
journal= {arXiv preprint arXiv:2303.03127},
year = {2023}
}