中文

探究用于楔形文字文本语言与方言识别的机器学习方法

计算与语言 2020-09-24 v1

摘要

由于资源匮乏和分词问题,识别使用楔形文字符号书写的语言是一项困难的任务。VarDial 2019 中的楔形文字语言识别任务旨在解决识别七种以楔形文字书写的语言和方言的问题:苏美尔语以及阿卡德语的六种方言——古巴比伦语、中巴比伦边缘语、标准巴比伦语、新巴比伦语、晚期巴比伦语和新亚述语。本文描述了 SharifCL 团队在 VarDial 2019 中针对该问题所采取的方法。最佳结果来自支持向量机与朴素贝叶斯分类器的集成,二者均基于字符级特征工作,宏平均 F1 分数为 72.10%。

关键词

引用

@article{arxiv.2009.10794,
  title  = {Investigating Machine Learning Methods for Language and Dialect Identification of Cuneiform Texts},
  author = {Ehsan Doostmohammadi and Minoo Nassajian},
  journal= {arXiv preprint arXiv:2009.10794},
  year   = {2020}
}