中文

由语言模型丰富的文本范畴的幅度

范畴论 2025-11-26 v2 计算与语言

摘要

本文的目的有两方面。首先,我们使用语言模型给出的下一词元概率,在Bradley、Terilla和Vlassopoulos的意义上,显式地定义了一个在单位区间上丰富的自然语言文本范畴。我们明确考虑了文本生成的终止条件,并确定了该丰富本身何时可以被解释为文本上的概率。其次,我们计算了相关联的广义文本度量空间的Möbius函数和幅度。该空间的幅度函数是与每个提示相关联的下一词元概率分布的tt-对数(Tsallis)熵在文本(提示)上的总和,加上模型可能输出的基数。幅度函数导数的适当求值恢复了Shannon熵的总和,这证明了将幅度视为配分函数是合理的。遵循Leinster和Shulman,我们还将广义度量空间的幅度函数表示为幅度同调的Euler示性数,并提供了第零和第一幅度同调群的显式描述。

关键词

引用

@article{arxiv.2501.06662,
  title  = {The magnitude of categories of texts enriched by language models},
  author = {Tai-Danae Bradley and Juan Pablo Vigneaux},
  journal= {arXiv preprint arXiv:2501.06662},
  year   = {2025}
}

备注

26 pages