中文

映射为频率和长度时间序列的原文与译文的广义 Hurst 指数及多重分形函数

数据分析、统计与概率 2012-09-11 v1 统计力学 斑图形成与孤子 物理与社会

摘要

非线性动力学方法可用于量化书面文本的复杂性。作为第一步,我们考察一个一维系统:将一位作者(Lewis Carroll)的两篇书面文本及其翻译成人工语言(即世界语 Esperanto)的版本映射为时间序列。使用它们对应的打乱版本来获取“基线”。此处使用了两种不同的一维时间序列:(i) 一种基于词长 (LTS),(ii) 另一种基于词频 (FTS)。结果表明,原文和译文的广义 Hurst 指数 h(q)h(q) 及导出的 f(α)f(\alpha) 曲线显示出显著差异。原文“文本”远未给出抛物线形的 f(α)f(\alpha) 函数,这与打乱后的文本形成对比。此外,世界语文本具有更极端的值。这表明最终形成的书面文本具有类似级联模型的特征,并具备多尺度时间不对称性。文中还讨论了映射为 LTS 或 FTS 的差异与互补性。FTS 的 f(α)f(\alpha) 曲线比 LTS 的曲线更开阔。

关键词

引用

@article{arxiv.1208.6174,
  title  = {Generalized Hurst exponent and multifractal function of original and translated texts mapped into frequency and length time series},
  author = {Marcel Ausloos},
  journal= {arXiv preprint arXiv:1208.6174},
  year   = {2012}
}

备注

preprint for PRE; 2 columns; 10 pages; 6 (multifigures); 3 Tables; 70 references