基于深度表示学习的中世纪拉丁语集成序列标注
计算与语言
2023-06-22 v2 机器学习
机器学习
摘要
本文考虑中世纪拉丁语的两个序列标注任务:词性标注和词形还原。这两者都是诸如文本复用检测等应用中的基础且关键的预处理步骤。然而,它们通常因中世纪拉丁语典型的大量拼写变体而变得复杂。在数字古典学中,这些任务传统上以 (i) 级联式和 (ii) 依赖词典的方式解决。例如,使用词典为某个词元生成所有可能的 lemma-tag 对,接着使用上下文感知的词性标注器选择最合适的 tag-lemma 对。除了未登录词项的问题外,错误传播是此类方法的主要缺点。本文探索使用单一的集成方法优雅地解决这些任务的可能性。为此,我们利用了来自深度表示学习领域的分层神经网络架构。
引用
@article{arxiv.1603.01597,
title = {Integrated Sequence Tagging for Medieval Latin Using Deep Representation Learning},
author = {Mike Kestemont and Jeroen De Gussem},
journal= {arXiv preprint arXiv:1603.01597},
year = {2023}
}