中文

用于书面语言及其他符号序列的保持子指数分布和长程关联的代理模型

计算与语言 2026-03-04 v1 统计力学 基因组学

摘要

符号序列如书面语言和基因DNA显示特征频率分布和长程关联,跨越数百至数千个符号。语言中体现为对词频的齐普分律,以及跨越数百至数千个标记的持久关联;DNA中则体现为核苷酸组成和在嘌呤-嘧啶映射下的长记忆漫步。现有代理模型通常仅保留频率分布或关联属性,但二者无法同时保留。我们引入的代理模型同时满足两个约束:保留原始序列的经验符号频率,同时再现其长程关联结构,通过detrended fluctuation analysis(DFA)指数量化。我们的方法通过将分数型高斯噪声(FGN)映射到经验直方图来实现频率保留赋值,从而生成符号序列的代理。所得代理在一次级统计和长程尺度上与原始序列匹配,同时随机化短程依赖。我们在英语和拉丁文代表性文本上进行验证,展示了其在基因DNA中的更广泛适用性,证明了碱基组成和DFA尺度的再现。该方法为解耦符号系统的结构特征,以及测试尺度律和记忆效应在语言、DNA及其他符号领域起源假设提供了原则化工具。

关键词

引用

@article{arxiv.2603.02213,
  title  = {A Zipf-preserving, long-range correlated surrogate for written language and other symbolic sequences},
  author = {Marcelo A. Montemurro and Mirko Degli Esposti},
  journal= {arXiv preprint arXiv:2603.02213},
  year   = {2026}
}