中文

文本预处理对于在线评论分类真的值得投入时间吗?

计算与语言 2018-08-31 v2 人工智能

摘要

公共域上存在的在线评论很大比例为建设性内容,然而有显著比例本质有毒。这些评论包含大量拼写错误,使特征数量成倍增加,令 ML 模型难以训练。考虑到数据科学家约 80% 的时间用于收集、清理与组织数据 [1],我们探究在将原始评论输入最先进的分类模型之前,应在预处理(变换)上投入多少精力。借助 Jigsaw 有毒评论分类数据上的四个模型,我们证明未经任何变换的模型训练能产生相对不错的模型。应用即便基础的变换,在某些情况下也会导致更差的性能,故应谨慎使用。

关键词

引用

@article{arxiv.1806.02908,
  title  = {Is preprocessing of text really worth your time for online comment classification?},
  author = {Fahim Mohammad},
  journal= {arXiv preprint arXiv:1806.02908},
  year   = {2018}
}

备注

11 pages,including Appendix