甲骨文字形演化开放数据集:EVOBC
人工智能
2024-02-14 v2
摘要
现存最早的中国文字源于甲骨文,它们与其他东亚语言密切相关。这些铭文对人类学和考古学具有巨大价值。然而,破译甲骨文仍然是一项艰巨的挑战,在迄今已发现的 4500 多个文字中,仅有约 1600 个被释读。要全面理解这一古老的书写体系,还需要进一步的学术研究。人工智能技术是破译甲骨文,特别是研究其字形演化的一条有前景的途径。然而,挑战之一在于缺乏能够映射这些文字随时间演变的数据集。在本研究中,我们系统地从权威文献和网站中收集了跨越六个历史阶段的古文字:甲骨文(公元前 15 世纪)、金文(公元前 13 世纪至公元前 221 年)、篆书(公元前 11 世纪至公元前 8 世纪)、春秋时期文字(公元前 770 年至公元前 476 年)、战国时期文字(公元前 475 年至公元前 221 年)和隶书(公元前 221 年至公元 220 年)。随后,我们构建了一个大规模数据集,即甲骨文演化数据集(EVOBC),包含 229,170 张图像,代表 13,714 个不同的字符类别。我们在构建的数据集上进行了验证和模拟破译,结果表明该数据集在辅助甲骨文研究方面具有高效性。这个公开可访问的数据集旨在将多个时代的中国古代文字数字化,通过研究字形形态的演变来促进甲骨文的破译。
引用
@article{arxiv.2401.12467,
title = {An open dataset for the evolution of oracle bone characters: EVOBC},
author = {Haisu Guan and Jinpeng Wan and Yuliang Liu and Pengjie Wang and Kaile Zhang and Zhebin Kuang and Xinyu Wang and Xiang Bai and Lianwen Jin},
journal= {arXiv preprint arXiv:2401.12467},
year = {2024}
}