中文

SumTablets:索美尔陶律片段的音转写数据集

计算与语言 2026-02-26 v1

摘要

索美尔音转写是一种将学者对陶律片段的解释以拉丁脚本表示的惯用系统。得益于 ETCSL、CDLI 和 Oracc 等数字化阿育提学项目,大量索美尔音转写数据已在线发布,且数据结构良好,适用于多种搜索和分析任务。然而,缺乏将音转写与陶律象形数字表示配对的完整、可访问数据集,阻碍了现代自然语言处理(NLP)方法在索美尔音转写任务中的应用。为填补这一空白,我们提出 SumTablets 数据集,将 91,606 块索美尔陶律象形(总计 6,970,407 个象形)的 Unicode 表示与 Oracc 发布的关联音转写配对。我们首先对 Oracc 音转写进行预处理和标准化,再将每个读法映射回源象形的 Unicode 表示。此外,我们通过特殊标记保留了并行的结构信息(如表面、换行、破损段等)。我们以 CC BY 4.0 许可证发布 SumTablets 作为 Hugging Face 数据集,并通过 GitHub 开源数据准备代码。此外,我们利用 SumTablets 实现并评估了两种音转写基线方法:(1) 从象形的可能读法中进行加权抽样,(2) 微调自回归语言模型。我们的微调模型在平均字符级 F 分数(chrF)上达到 97.55,显示现基于 Transformer 的音转写模型在使专家快速验证生成的音转写方面具有巨大潜力,无需逐一手动音转写陶律片段。

关键词

引用

@article{arxiv.2602.22200,
  title  = {SumTablets: A Transliteration Dataset of Sumerian Tablets},
  author = {Cole Simmons and Richard Diehl Martinez and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2602.22200},
  year   = {2026}
}

备注

11 pages with 3 figures