中文

关于随机程序几何与同调的统计探讨

计算与语言 2024-07-09 v1

摘要

AI 支持的编程随着诸如 Meta 的 Llama 和 OpenAI 的 chatGPT 等工具的出现而迎来了巨大的进步。这类工具是随机程序的来源,已经深刻影响了我们如何编写代码和教授编程。如果将这些模型的输入视为随机来源,一个自然的问题是:输入分布与输出分布之间存在什么关系,chatGPT 提示与生成的程序之间存在什么关系?本文将展示,如何无需显式建模底层空间,即可几何地和拓扑地描述从 chatGPT 生成的随机 Python 程序之间的关系,这通过程序语法树之间的树编辑距离来实现。研究高维样本在度量空间中的常用方法是使用例如多维尺度压缩(multidimensional scaling)的低维嵌入。此类方法会受数据和嵌入空间维度的影响产生误差。本文提议将此类投影方法限制为纯粹的可视化目的,改用几何概括统计量、空间点统计方法以及拓扑数据分析来刻画随机程序的配置,这些方法不依赖于嵌入近似。为演示其有用性,我们在与图像处理相关的简单问题上,对比两个公开可用的模型:ChatGPT-4 和 TinyLlama。应用领域包括:理解如何提问以获得有用的程序;衡量给定大型语言模型回答的一致性;以及将不同大型语言模型作为编程助手进行比较。最后,我们推测,这种方法在未来可能为编程语言的结构提供新的见解。

关键词

引用

@article{arxiv.2407.04854,
  title  = {Statistical investigations into the geometry and homology of random programs},
  author = {Jon Sporring and Ken Friis Larsen},
  journal= {arXiv preprint arXiv:2407.04854},
  year   = {2024}
}

备注

16 pages, 11 figures