中文

统计流形中自然语言的关联维数

计算与语言 2024-05-16 v2 统计力学 人工智能

摘要

通过将 Grassberger-Procaccia 算法应用于大型语言模型生成的高维序列,测量了自然语言的关联维数。该方法先前仅在欧几里得空间中研究过,现通过 Fisher-Rao 距离在统计流形中重新表述。语言展现出多重分形特性,具有全局自相似性,其普适维数约为 6.5,小于简单离散随机序列的维数,但大于 Barabási-Albert 过程的维数。长程记忆是产生自相似性的关键。我们的方法适用于任何真实世界离散序列的概率模型,并展示了其在音乐数据上的应用。

关键词

引用

@article{arxiv.2405.06321,
  title  = {Correlation Dimension of Natural Language in a Statistical Manifold},
  author = {Xin Du and Kumiko Tanaka-Ishii},
  journal= {arXiv preprint arXiv:2405.06321},
  year   = {2024}
}

备注

Published at Physical Review Research