复杂系统分类的方法:词语、文本及更多
数据分析、统计与概率
2024-01-04 v1 统计力学
计算与语言
其他定量生物学
摘要
本章以关于量化语言学概念的介绍性信息开始,如秩—频依赖、Zipf 定律、频谱等。文本中词语分布与量子系综中能级占据的相似性暗示了与统计物理的表层类比。这使得人们能够基于该物理类比定义文本的各种参数,包括“温度”、“化学势”、熵及其他一些量。此类参数为分类文本提供了一组变量,可作为复杂系统的例子。此外,文本或许是易于收集和分析的最简单的复杂系统。由于众所周知的语言学类比,类似方法可被发展用于研究例如基因组。我们考虑了几种定义线粒体 DNA 和病毒 RNA 中核苷酸序列的方法,并展示了它们作为基因组比较分析辅助工具的可能应用。最后,我们讨论熵作为参数之一,它可容易地从秩—频依赖中计算。作为复杂系统分类某些问题中的判别参数,熵仅能在有限类问题中给予恰当解释。其整体作用与意义迄今仍是一个开放问题。
引用
@article{arxiv.2205.04060,
title = {Approaches to the classification of complex systems: Words, texts, and more},
author = {Andrij Rovenchak},
journal= {arXiv preprint arXiv:2205.04060},
year = {2024}
}
备注
Chapter submitted to the book: Order, Disorder and Criticality: Advanced Problems of Phase Transition Theory. Ed. by Yu. Holovatch. Vol. 7, 2022, World Scientific, Singapore