我们是否在测试数据上训练?近重复样本对车牌识别的影响
计算机视觉与模式识别
2023-08-07 v2
摘要
本工作提请注意车牌识别(LPR)研究中广泛采用的数据集的训练集和测试集中存在大量近重复样本。这些重复样本指的是虽然不同但显示同一车牌的图像。我们在该领域两个最流行数据集上进行的实验表明,当六个知名模型在公平划分(即训练集和测试集中无重复样本)下训练和测试时,识别率大幅下降。此外,在其中一个数据集中,当模型在無重复划分下训练和测试时,其排名发生了显著变化。这些发现表明,此类重复样本已严重偏置了基于深度学习的 LPR 模型的评估与开发。我们发现的近重复样本列表以及公平划分方案已公开于 https://raysonlaroca.github.io/supp/lpr-train-on-test/ 以供进一步研究。
引用
@article{arxiv.2304.04653,
title = {Do We Train on Test Data? The Impact of Near-Duplicates on License Plate Recognition},
author = {Rayson Laroca and Valter Estevam and Alceu S. Britto and Rodrigo Minetto and David Menotti},
journal= {arXiv preprint arXiv:2304.04653},
year = {2023}
}
备注
Accepted for presentation at the International Joint Conference on Neural Networks (IJCNN) 2023