中文

将古埃及语中的词符识别作为低资源序列标注任务

计算与语言 2024-07-02 v1

摘要

复杂的古埃及语(AE)书写系统的特征是广泛使用字素词符(限定符):不发音的象形文字符号,用于阐明词义或指示宿主词的发音。随着 iClassifier 项目的启动和快速发展,对词符的研究近年来不断加强,这是一个用于标注和分析古代及现代语言中词符的网络平台。得益于项目参与者贡献的数据,现在可以将 AE 文本中的词符识别表述为一项 NLP 任务。在本文中,我们通过实现一系列序列标注神经模型,向解决该任务迈出了第一步,尽管训练数据量有限,这些模型仍取得了有前景的性能。我们讨论了处理 AE 文本时出现的分词与操作化问题,并将我们的方法与基于频率的基线进行了对比。

关键词

引用

@article{arxiv.2407.00475,
  title  = {Classifier identification in Ancient Egyptian as a low-resource sequence-labelling task},
  author = {Dmitry Nikolaev and Jorke Grotenhuis and Haleli Harel and Orly Goldwasser},
  journal= {arXiv preprint arXiv:2407.00475},
  year   = {2024}
}

备注

Accepted to ML4AL 2024 (First Machine Learning for Ancient Languages Workshop)