单样本书写者——“文档过滤器”及其对笔迹识别的影响
计算机视觉与模式识别
2020-05-19 v1
摘要
书写可作为一种重要的生物特征模态,能够明确识别个体。这是因为不同人的书写存在差异,这些差异既可从图形测量特性方面加以探究,也可将手稿视为数字图像,借助能够恰当捕捉图像不同视觉属性(如纹理)的图像处理技术来进行分析。本文开展了一项细致研究,剖析使用仅含部分书写者单一样本的数据库是否会令实验协议所得结果产生偏倚。为此,我们提出了所谓的“文档过滤器”。该“文档过滤器”协议应作为一种预处理技术使用,即同一文档片段提取的所有数据必须全部放入训练集或测试集之一。其背后的原理在于,分类器须捕捉书写者自身的特征,而非可能受特定文档影响书写的其他特性(即书写者的情绪状态、所用笔具、纸张类型等)。通过文献分析可见,已有若干研究涉及笔迹识别问题。然而,笔迹识别系统的性能评估亦须考虑在手稿数据库构建过程中仅贡献了单一样本的书写者志愿者的情况。为探讨此处研究的开放性问题,我们在 IAM、BFL 和 CVL 数据库上开展了一系列综合实验。结果表明,在最极端情形下,采用“文档过滤器”协议所得的识别率从 81.80% 降至 50.37%。
引用
@article{arxiv.2005.08424,
title = {Single-sample writers -- "Document Filter" and their impacts on writer identification},
author = {Fabio Pinhelli and Alceu S. Britto and Luiz S. Oliveira and Yandre M. G. Costa and Diego Bertolini},
journal= {arXiv preprint arXiv:2005.08424},
year = {2020}
}