面向神经中文拼音输入法的开放词表学习
人工智能
2019-06-07 v4 计算与语言
摘要
拼音转汉字(P2C)转换是基于拼音的中文输入法引擎(IME)的核心组件。然而,由于对应拼音的汉字存在歧义以及预定义固定词表的限制,该转换受到严重影响。为缓解此类不便,我们提出一种神经P2C转换模型,其通过带采样机制的在线更新词表进行增强,以支持IME工作期间的开放词表学习。我们的实验表明,所提方法在标准语料库与真实输入历史数据集上,在多项指标方面均优于商业IME与当前最优传统模型,因此在线更新词表确实帮助我们的IME有效适应用户输入行为。
引用
@article{arxiv.1811.04352,
title = {Open Vocabulary Learning for Neural Chinese Pinyin IME},
author = {Zhuosheng Zhang and Yafang Huang and Hai Zhao},
journal= {arXiv preprint arXiv:1811.04352},
year = {2019}
}
备注
Accepted by ACL 2019