超越流水线:端到端深度学习在历史文档书写者识别中的关键因素分析
计算机视觉与模式识别
2025-10-22 v1
摘要
本文研究了影响端到端深度学习方法在历史书写者识别(HWI)中性能的各种因素。由于书写风格的多样性、文档退化以及每位书写者的标注样本数量有限,HWI 仍然是一项具有挑战性的任务。这些条件通常使得即使对人类专家而言也难以进行准确识别。传统的 HWI 方法通常依赖于手工设计的图像处理与聚类技术,这些方法在小型且精心整理的数据集上往往表现良好。相比之下,端到端流水线旨在通过直接从文档图像中学习特征来自动化该过程。然而,我们的实验表明,许多此类模型在更真实的文档级设置中难以泛化,尤其是在测试集中的书写者未出现在训练数据中的零样本场景下。我们探索了预处理方法、骨干网络架构与后处理策略的不同组合,包括文本分割、图像块采样与特征聚合。结果表明,由于对低级视觉特征捕获能力弱、图像块表示不一致以及对内容噪声高度敏感,大多数配置表现不佳。尽管如此,我们确定了一种端到端设置,尽管设计更简单,却取得了与表现最佳的系统相当的结果。这些发现指出了构建鲁棒的端到端系统所面临的关键挑战,并为改善历史文档书写者识别性能的设计选择提供了见解。
引用
@article{arxiv.2510.18671,
title = {Beyond the Pipeline: Analyzing Key Factors in End-to-End Deep Learning for Historical Writer Identification},
author = {Hanif Rasyidi and Moshiur Farazi},
journal= {arXiv preprint arXiv:2510.18671},
year = {2025}
}
备注
Published in The 12th IEEE International Conference on Data Science and Advanced Analytics (DSAA), 2025