中文

超越泥泞:越野赛车计算机视觉的数据集与基准

计算机视觉与模式识别 2024-02-14 v1

摘要

尽管光学字符识别 (OCR) 和计算机视觉系统取得了显著进展,但在无约束的野外 (in-the-wild) 环境中稳健地识别图像中的文本和人物仍然是一个持续的挑战。然而,在视觉系统的实际应用中必须克服此类障碍,例如识别越野赛车事件照片中的人物。为此,我们引入了两个具有挑战性的新现实世界数据集——越野摩托车车手号码数据集 (RND) 和泥泞车手重识别数据集 (MUDD)——以突显当前方法的不足,并推动极端条件下 OCR 和人员重识别 (ReID) 的进步。这两个数据集包含超过 6,300 张在越野比赛期间拍摄的图像,展现了各种甚至能削弱现代视觉系统的因素,即泥泞、复杂姿势和运动模糊。我们使用最先进模型在两个数据集上建立了基准性能。现成模型的迁移效果较差,在文本 spotting 任务上的端到端 (E2E) F1 分数仅为 15%,在 ReID 任务上的 Rank-1 准确率仅为 33%。微调带来了重大改进,将 E2E 文本 spotting 的模型性能提升至 53% F1 分数,ReID 的 Rank-1 准确率提升至 79%,但仍未能达到良好的性能水平。我们的分析揭示了现实世界 OCR 和 ReID 中存在的开放性问题,这些问题需要针对特定领域的技术来解决。通过这些数据集和对模型局限性的分析,我们旨在促进处理泥泞和复杂姿势等现实世界条件的创新,从而推动稳健计算机视觉的进步。所有数据均 sourced from PerformancePhoto.co,这是一个被专业赛车摄影师、车手和粉丝使用的网站。表现最佳的文本 spotting 和 ReID 模型已部署在该平台上,为实时赛车照片搜索提供支持。

关键词

引用

@article{arxiv.2402.08025,
  title  = {Beyond the Mud: Datasets and Benchmarks for Computer Vision in Off-Road Racing},
  author = {Jacob Tyo and Motolani Olarinre and Youngseog Chung and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:2402.08025},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2311.09256