应用于词汇错误恢复的鲁棒文本处理技术
cmp-lg
2009-09-25 v1 计算与语言
摘要
本文探讨自动词汇错误恢复与错误文本输入的分词问题。提出了一种统一框架下的技术,可自动纠正拼写错误、分词错误和真实词错误,该框架同时使用语言生成模型和打字行为模型,并将分词作为恢复过程的一部分。打字过程被建模为一个噪声信道,使用隐马尔可夫模型(Hidden Markov Models)来建模信道特征。弱统计语言模型用于预测可能通过该信道传输的句子。这些组件在 Token Passing 框架中结合在一起,实现了正字法模式匹配与语言期望之间的紧密耦合。系统 CTR(Connected Text Recognition)已在两个源自不同应用的语料库上进行了测试:一个是自然语言对话系统,另一个是转录打字场景。实验表明,CTR 可以在不引入过多噪声的情况下自动纠正测试集中相当大比例的错误。分词错误纠正率几乎完美无误。
引用
@article{arxiv.cmp-lg/9702003,
title = {A Robust Text Processing Technique Applied to Lexical Error Recovery},
author = {Peter Ingels},
journal= {arXiv preprint arXiv:cmp-lg/9702003},
year = {2009}
}
备注
Licentiate Thesis, 101 pages