中文

基于深度表示学习的中世纪拉丁语集成序列标注

计算与语言 2023-06-22 v2 机器学习 机器学习

摘要

本文考虑中世纪拉丁语的两个序列标注任务:词性标注和词形还原。这两者都是诸如文本复用检测等应用中的基础且关键的预处理步骤。然而,它们通常因中世纪拉丁语典型的大量拼写变体而变得复杂。在数字古典学中,这些任务传统上以 (i) 级联式和 (ii) 依赖词典的方式解决。例如,使用词典为某个词元生成所有可能的 lemma-tag 对,接着使用上下文感知的词性标注器选择最合适的 tag-lemma 对。除了未登录词项的问题外,错误传播是此类方法的主要缺点。本文探索使用单一的集成方法优雅地解决这些任务的可能性。为此,我们利用了来自深度表示学习领域的分层神经网络架构。

关键词

引用

@article{arxiv.1603.01597,
  title  = {Integrated Sequence Tagging for Medieval Latin Using Deep Representation Learning},
  author = {Mike Kestemont and Jeroen De Gussem},
  journal= {arXiv preprint arXiv:1603.01597},
  year   = {2023}
}