面向情感基文本分类的日文分词器实验评估
计算与语言
2024-12-24 v1
摘要
本研究探讨了三种流行的分词工具——MeCab、Sudachi 和 SentencePiece——在用于情感基文本分类日本文本时的性能。我们采用术语频率-逆文档频率 (TF-IDF) 向量化方法,评估两种传统机器学习分类器:多项式朴素贝叶斯和逻辑回归。结果表明,Sudachi 生成的标记与词典定义高度吻合,而 MeCab 和 SentencePiece 显示出更快的处理速度。SentencePiece、TF-IDF 和逻辑回归的组合在分类性能方面优于其他替代方案。
引用
@article{arxiv.2412.17361,
title = {An Experimental Evaluation of Japanese Tokenizers for Sentiment-Based Text Classification},
author = {Andre Rusli and Makoto Shishido},
journal= {arXiv preprint arXiv:2412.17361},
year = {2024}
}
备注
Accepted at The 27th Annual Meeting of the Association for Natural Language Processing (NLP2021). Published version available at: https://www.anlp.jp/proceedings/annual_meeting/2021/pdf_dir/D3-1.pdf