利用深度学习复原古代文本:以希腊铭文为例
计算与语言
2019-10-15 v1 计算机与社会
摘要
古代史依赖于铭文学(研究古代铭刻文本)等学科作为已记录过去的证据。然而,这些被称为“铭文”的文本历经数世纪常遭损坏,文本中无法辨认的部分必须由称为铭文学家的专家复原。本工作提出 Pythia,首个利用深度神经网络从受损文本输入中恢复缺失字符的古代文本复原模型。其架构经过精心设计以处理长期上下文信息,并高效应对缺失或受损的字符与词表示。为训练该模型,我们编写了一套非平凡流水线,将最大的古希腊铭文数字语料库 PHI 转换为机器可处理文本,称之为 PHI-ML。在 PHI-ML 上,Pythia 的预测字符错误率为 30.1%,而人类铭文学家的为 57.3%。此外,在 73.5% 的案例中,真值序列出现在 Pythia 的 Top-20 假设中,这有效展示了该辅助方法对数字铭文学领域的影响,并确立了古代文本复原的 SOTA。
引用
@article{arxiv.1910.06262,
title = {Restoring ancient text using deep learning: a case study on Greek epigraphy},
author = {Yannis Assael and Thea Sommerschield and Jonathan Prag},
journal= {arXiv preprint arXiv:1910.06262},
year = {2019}
}