中文

HieroLM:基于下一个词预测语言模型的埃及象形文字恢复

计算与语言 2025-03-10 v1

摘要

埃及象形文字出现在众多古埃及文物上,但它们常常因侵蚀而模糊甚至缺失。现有恢复模糊象形文字的努力采用计算机视觉技术,如 CNN,将象形文字恢复建模为图像分类任务,这存在两个主要限制:(i)它们无法处理严重损坏或完全缺失的象形文字。(ii)它们基于单个象形文字进行预测,而不考虑上下文和语法信息。本文提出了一种将象形文字恢复建模为下一个词预测任务的新方法,并使用语言模型来解决。我们比较了不同最先进语言模型的性能,并选择 LSTM 作为 HieroLM 的架构,因为埃及象形文字文本中语义具有强烈的局部关联性。实验表明,HieroLM 实现了超过 44% 的准确率,并在多样本预测和数据稀缺场景下保持显著性能,使其成为辅助学者推断缺失象形文字的实用工具。它还可以补充基于 CV 的模型,显著降低识别模糊象形文字的困惑度。我们的代码可在 https://github.com/Rick-Cai/HieroLM/ 获取。

关键词

引用

@article{arxiv.2503.04996,
  title  = {HieroLM: Egyptian Hieroglyph Recovery with Next Word Prediction Language Model},
  author = {Xuheng Cai and Erica Zhang},
  journal= {arXiv preprint arXiv:2503.04996},
  year   = {2025}
}

备注

Accepted at LaTeCH-CLfL 2025 @ NAACL 2025