中文

两种用于自然语言聚类现象的涨落分析方法比较:Taylor 与 Ebeling & Neiman 方法

计算与语言 2021-05-05 v1 应用统计

摘要

本文考虑 Taylor 与 Ebeling & Neiman 的涨落分析方法。虽然两者都已被应用于统计力学领域的各种现象,但它们的异同尚未被阐明。在考察其分析特性后,本文将这些方法大规模应用于文本。研究发现,两种方法都能区分真实文本与独立同分布(i.i.d.)序列。此外,从词获得的 Taylor 指数可粗略区分文本类别;Ebeling 和 Neiman 指数也有此效果,但程度较弱。另外,两种方法都显示出捕捉文字种类的一些可能性。

关键词

引用

@article{arxiv.2009.06257,
  title  = {A Comparison of Two Fluctuation Analyses for Natural Language Clustering Phenomena: Taylor and Ebeling & Neiman Methods},
  author = {Kumiko Tanaka-Ishii and Shuntaro Takahashi},
  journal= {arXiv preprint arXiv:2009.06257},
  year   = {2021}
}