用于中文与日语基于RNN情感分析的偏旁级表意文字编码器
计算与语言
2017-08-11 v1
摘要
在中文和日文等非字母语言中,字符词汇表可能非常大,这使得神经网络模型在处理此类语言时规模庞大。我们探索了一种用于情感分类的模型,该模型采用中文字符(即中文的汉字和日文的汉字)偏旁的嵌入。我们的模型由一个 CNN 词特征编码器和一个双向 RNN 文档特征编码器组成。所取得的结果与基于字符嵌入的模型相当,并接近 state-of-the-art 的基于词嵌入的模型,且词汇表缩小了 90%,参数量分别比基于字符嵌入的模型和基于词嵌入的模型至少减少 13% 和 80%。结果表明,基于偏旁嵌入的方法对于中文和日文的机器学习具有成本效益。
引用
@article{arxiv.1708.03312,
title = {Radical-level Ideograph Encoder for RNN-based Sentiment Analysis of Chinese and Japanese},
author = {Yuanzhi Ke and Masafumi Hagiwara},
journal= {arXiv preprint arXiv:1708.03312},
year = {2017}
}
备注
12 pages, 4 figures