评估历史文本正则化系统:其泛化能力究竟如何?
计算与语言
2018-04-16 v2
摘要
我们指出了历史文本正则化系统评估中存在的若干使得难以判断这些系统在实际中(即面对新数据集或语言时、与更朴素的系统相比时、或作为下游 NLP 工具预处理步骤时)真实表现的问题。我们通过将两个神经模型与一个朴素基线系统进行对比,阐明了这些问题并示例了我们提出的评估实践。我们表明,在五种语言的测试中,神经模型对未见词具有良好的泛化能力;然而,对于一份英语历史语料的下游词性标注任务,它们相比朴素基线并无明显益处。我们得出结论:未来的工作应包含更严格的评估,包括尽可能同时采用内在与外在度量。
引用
@article{arxiv.1804.02545,
title = {Evaluating historical text normalization systems: How well do they generalize?},
author = {Alexander Robertson and Sharon Goldwater},
journal= {arXiv preprint arXiv:1804.02545},
year = {2018}
}
备注
Accepted to NAACL 2018