两种结构的故事:LLM 是否捕捉到语言的分形复杂性?
计算与语言
2025-05-27 v2 人工智能
摘要
语言在信息论复杂性(即每 token 位数)中表现出分形结构,具有跨尺度的自相似性和长程依赖(LRD)。本文探讨大语言模型(LLM)是否能够复制此类分形特征,以及在何种条件下(如温度设置和提示方法)可能失败。此外,我们发现自然语言中观察到的分形参数落在狭窄范围内,而 LLM 输出的分形参数范围较宽,表明分形参数可能有助于检测 LLM 生成文本的非平凡部分。值得注意的是,本文的这些发现以及许多其他报告对体系结构选择是稳健的;例如,Gemini 1.0 Pro、Mistral-7B 和 Gemma-2B。我们还发布了一个包含超过 24 万篇由各种 LLM(包括预训练和指令调优模型)生成的文章的数据集,涵盖不同的解码温度和提示方法,以及相应的人类生成文本。我们希望本工作凸显了分形属性、提示方法与 LLM 统计模仿之间的复杂相互作用,为生成、评估和检测合成文本提供了见解。
引用
@article{arxiv.2502.14924,
title = {A Tale of Two Structures: Do LLMs Capture the Fractal Complexity of Language?},
author = {Ibrahim Alabdulmohsin and Andreas Steiner},
journal= {arXiv preprint arXiv:2502.14924},
year = {2025}
}