中文

中、英、日、韩文本分类的最佳编码方式是什么?

计算与语言 2017-08-18 v2 机器学习

摘要

本文对中文、日文、韩文(CJK)和英文在文本分类中的不同编码方式进行了实证研究。研究了不同的编码级别,包括 UTF-8 字节、字符、词、罗马化字符和罗马化词。对于所有编码级别,在适用的情况下,我们提供了线性模型、fastText 和卷积网络的比较。对于卷积网络,我们比较了使用字符字形图像、one-hot(或 one-of-n)编码和嵌入的编码机制。总共有 473 个模型,使用了 4 种语言(包括中文、英文、日文和韩文)的 14 个大规模文本分类数据集。从这些结果中得出的一些结论包括:基于 UTF-8 的字节级 one-hot 编码在卷积网络中始终产生有竞争力的结果;词级 n-gram 线性模型即使在没有完美分词的情况下也具有竞争力;fastText 使用字符级 n-gram 编码可提供最佳结果,但当特征过于丰富时可能会过拟合。

关键词

引用

@article{arxiv.1708.02657,
  title  = {Which Encoding is the Best for Text Classification in Chinese, English, Japanese and Korean?},
  author = {Xiang Zhang and Yann LeCun},
  journal= {arXiv preprint arXiv:1708.02657},
  year   = {2017}
}