中文

基于深度学习与嵌入可视化的多语言文本分类与识别比较分析

计算与语言 2023-12-08 v1

摘要

本研究利用深度学习和嵌入可视化,对多语言文本分类方法进行了比较研究。该研究在包含 17 种语言的数据集上采用了 LangDetect、LangId、FastText 和 Sentence Transformer。它探讨了维度对聚类的影响,揭示了 FastText 由于其广泛的多语言语料库训练,在 2D 可视化中展现出更清晰的聚类。值得注意的是,FastText 多层感知机模型实现了显著的准确率、精确率、召回率和 F1 分数,优于 Sentence Transformer 模型。该研究强调了这些技术在多语言文本分类中的有效性,并强调了大型多语言语料库对于训练嵌入的重要性。它为未来的研究奠定了基础,并协助从业者开发语言检测和分类系统。此外,它还包括了多层感知机、LSTM 和卷积模型在分类上的比较。

关键词

引用

@article{arxiv.2312.03789,
  title  = {Comparative Analysis of Multilingual Text Classification & Identification through Deep Learning and Embedding Visualization},
  author = {Arinjay Wyawhare},
  journal= {arXiv preprint arXiv:2312.03789},
  year   = {2023}
}

备注

9 Pages, 10 Figures, 1 Table