用于甲骨文识别与考释的开放数据集
计算机视觉与模式识别
2024-09-04 v4
摘要
甲骨文是已知最早的中国古代文字形式之一,为研究 3,000 年前商朝人文学科与地理的学者提供了宝贵的研究资料。这些文字巨大的历史和文化意义不言而喻。然而,随着时间的流逝,其大部分含义已变得模糊,给考释这些古代文本带来了重大挑战。随着人工智能(AI)的出现,利用 AI 辅助考释甲骨文已成为一种可行的选择。然而,高质量数据集的缺乏阻碍了该领域的进展。为了解决这个问题,本文详细介绍了 HUST-OBC 数据集的构建。该数据集包含 1,588 个已考释单字的 77,064 张图像和 9,411 个未考释单字的 62,989 张图像,共计 140,053 张图像,汇集自多种来源。希望该数据集能够启发并辅助未来对未知甲骨文的考释研究。所有代码和数据集可在 https://github.com/Yuliang-Liu/Open-Oracle 获取。
引用
@article{arxiv.2401.15365,
title = {An open dataset for oracle bone script recognition and decipherment},
author = {Pengjie Wang and Kaile Zhang and Xinyu Wang and Shengwei Han and Yongge Liu and Jinpeng Wan and Haisu Guan and Zhebin Kuang and Lianwen Jin and Xiang Bai and Yuliang Liu},
journal= {arXiv preprint arXiv:2401.15365},
year = {2024}
}