全唐诗的本体词分割
计算与语言
2019-08-29 v1 人工智能
机器学习
摘要
我们的目标是对全唐诗 (CTP) 进行分词。虽然在不进行全规模分词的情况下也可以对 CTP 进行一些研究,但为了开展高级研究课题,我们必须推进对 CTP 的词级分析。在 2018 年 11 月我们向 DH 2019 (ADHO) 提交稿件时,我们仅收集了由训练有素的专家分词的 2433 首诗,并使用这些分词后的诗歌来评估考虑了中国诗歌领域知识的分词器。我们基于 CTP 诗歌(不包括 2433 首诗,这些诗专门仅用于测试)和领域知识训练了汉字之间的逐点互信息 (PMI)。该分词器依靠 PMI 信息恢复了测试诗中 85.7% 的词。然而,我们只能在 17.8% 的情况下将一首诗完全正确地分词。当我们在 DH 2019 上展示我们的工作时,我们已经标注了超过 20000 首诗。凭借更大量的数据,我们能够将 biLSTM 模型应用于此分词任务,并且我们在超过 20% 的情况下能将一首诗完全正确地分词。相比之下,人工标注员在大约 40% 的情况下完全同意他们的标注。
引用
@article{arxiv.1908.10621,
title = {Onto Word Segmentation of the Complete Tang Poems},
author = {Chao-Lin Liu},
journal= {arXiv preprint arXiv:1908.10621},
year = {2019}
}
备注
5 pages, 2 tables, presented at the 2019 International Conference on Digital Humanities (ADHO)