古希腊纸草手稿中字符检测的对比学习
计算机视觉与模式识别
2024-09-17 v1 机器学习
摘要
本文研究了SimCLR(一种对比学习技术)在希腊字母识别中的有效性,重点关注各种数据增强技术的影响。我们使用Alpub数据集(预训练数据集)预训练SimCLR主干网络,并在较小的ICDAR数据集(微调数据集)上进行微调,以比较SimCLR与使用交叉熵和三元组损失函数的传统基线模型的性能。此外,我们探讨了不同数据增强策略的作用,这些策略对SimCLR训练过程至关重要。在方法上,我们考察了三种主要方法:(1) 使用交叉熵损失的基线模型,(2) 带分类层的三元组嵌入模型,以及 (3) 带分类层的SimCLR预训练模型。最初,我们在ICDAR数据集上使用93种增强方式在ResNet-18和ResNet-50网络上训练基线、三元组和SimCLR模型。从中使用统计t检验选出前四种增强方式。SimCLR的预训练在Alpub数据集上进行,随后在ICDAR数据集上进行微调。三元组损失模型经历了类似的过程,先在前四种增强方式上进行预训练,然后在ICDAR上进行微调。我们的实验表明,SimCLR在字母识别任务中并未优于基线。使用交叉熵损失的基线模型表现出比SimCLR和三元组损失模型更好的性能。本研究提供了对比学习在字母识别中的详细评估,突出了SimCLR的局限性,同时强调了传统监督学习模型在此任务中的优势。我们认为SimCLR的裁剪策略可能导致输入图像的语义偏移,尽管预训练数据集很大,但降低了训练效果。我们的代码可在 https://github.com/DIVA-DIA/MT_augmentation_and_contrastive_learning/ 获取。
引用
@article{arxiv.2409.10156,
title = {Contrastive Learning for Character Detection in Ancient Greek Papyri},
author = {Vedasri Nakka and Andreas Fischer and Rolf Ingold and Lars Vogtlin},
journal= {arXiv preprint arXiv:2409.10156},
year = {2024}
}