填补古代阿卡德语文本的空白:一种掩码语言建模方法
计算与语言
2021-10-26 v2
摘要
我们提出了能够根据古代美索不达米亚文献的音译补全缺失文本的模型,这些文献最初书写于楔形文字泥板上(公元前 2500 年至公元 100 年)。由于泥板的风化破损,学者们通常依赖上下文线索手动填补文本中的缺失部分,这一过程既主观又耗时。我们认识到,这一挑战可以被表述为掩码语言建模任务,该任务主要用作上下文语言模型的预训练目标。随后,我们针对当时的通用语——阿卡德语,开发了多种架构。我们发现,尽管数据稀缺(1M tokens),但通过贪婪解码方案以及在来自其他语言和不同时期的数据上进行预训练,我们可以在缺失 token 预测上达到 state of the art 的性能(89% hit@5)。最后,我们进行了人工评估,表明我们的模型在协助专家转录已消亡语言的文本方面具有适用性。
引用
@article{arxiv.2109.04513,
title = {Filling the Gaps in Ancient Akkadian Texts: A Masked Language Modelling Approach},
author = {Koren Lazar and Benny Saret and Asaf Yehudai and Wayne Horowitz and Nathan Wasserman and Gabriel Stanovsky},
journal= {arXiv preprint arXiv:2109.04513},
year = {2021}
}
备注
Accepted to EMNLP 2021 (Main Conference)