中文

基于 CNN 的楔形文字符号检测:从标注三维渲染图与光照增强映射照片中学习

计算机视觉与模式识别 2023-12-29 v1 人工智能 机器学习

摘要

受数字古代近东研究(DANES)界挑战的驱动,我们开发了处理楔形文字的数字工具,该文字是一种压印于泥板上的三维文字,使用了超过三千年且至少八种主要语言。它由数千个随时间和空间演变的字符组成。照片是用于机器学习最常见的表示,而墨线图易于产生解读偏差。最适宜的三维数据集正变得可用。我们创建并使用了 HeiCuBeDa 和 MaiCuBeDa 数据集,包含约 500 块标注泥板。针对我们这种面向混合图像数据的类 OCR 新方法,我们提供了额外的映射工具,用于在三维渲染图与照片间转移标注。我们的符号定位使用 RepPoints 检测器以边界框预测字符位置。我们使用来自 GigaMesh 的 MSII(曲率,见 https://gigamesh.eu)渲染图、Phong 着色三维模型以及照片,并采用光照增强。结果表明,使用渲染三维图像进行符号检测优于其他基于照片的工作。此外,我们的方法仅用照片也能获得相当好的结果,而在混合数据集上效果最佳。更重要的是,Phong 渲染图尤其是 MSII 渲染图改善了照片上的结果,而照片是全球尺度上最大的数据集。

关键词

引用

@article{arxiv.2308.11277,
  title  = {CNN based Cuneiform Sign Detection Learned from Annotated 3D Renderings and Mapped Photographs with Illumination Augmentation},
  author = {Ernst Stötzner and Timo Homburg and Hubert Mara},
  journal= {arXiv preprint arXiv:2308.11277},
  year   = {2023}
}

备注

This paper was accepted to ICCV23 and includes the DOI for an Open Access Dataset with annotated cuneiform script