唐代墓志铭的文言文分句
计算与语言
2019-08-29 v1 机器学习
摘要
唐代墓志铭提供了关于中国历史的宝贵信息。原始墓志铭是文言文文本,既不包含词边界也不包含句子边界。依托三本已出版的唐代墓志铭书籍,我们研究了采用机器学习方法以算法识别墓志铭中句子停顿和终结的有效性。我们将分句任务视为一个分类问题。后跟标点符号和不跟标点符号的汉字被分为两类。我们应用了一种基于机器学习的机制——条件随机场(CRF),对文本中的字(和词)进行分类,并研究了所选类型的词汇信息对分句建议最终质量的贡献。在 DH 2018 会议上提出的这一方案讨论了一些基础实验及其评估。通过考虑上下文信息并采用中国文学专家提供的启发式规则,我们取得了超过 80% 的 F1 分数。在最近的工作中,采用深度神经网络的更复杂实验帮助我们进一步改善了结果。
引用
@article{arxiv.1908.10606,
title = {Classical Chinese Sentence Segmentation for Tomb Biographies of Tang Dynasty},
author = {Chao-Lin Liu and Yi Chang},
journal= {arXiv preprint arXiv:1908.10606},
year = {2019}
}
备注
6 pages, 3 figures, 2 tables, presented at the 2019 International Conference on Digital Humanities (ADHO)