交叉熵博弈:从隐式知识到通用能力度量
人工智能
2025-06-24 v2 计算与语言
计算机科学与博弈论
信息论
神经与进化计算
math.IT
摘要
大型语言模型(LLM)定义了文本上的概率度量。通过思考LLM是否认识这种度量以及这代表什么算法含义这一隐式知识问题,我们自然地引出一系列超越生成性采样的任务,包括汇总、反事实思考、异常检测、原创性搜索、逆提示、辩论、创造性解题等。这些任务可作为基于LLM度量的博弈问题建模,我们称为交叉熵(Xent)博弈。Xent博弈可以是单人或多人游戏,涉及交叉熵得分和交叉熵约束,可表述为简单的计算图和程序。我们展示Xent博弈空间足够大,能够容纳大量有趣的例子,同时可从基本的博弈论一致性公理构建。随后我们讨论如何利用Xent博弈空间来衡量LLM的能力。这导致构建Xent博弈度量:由有限的Xent博弈族构成的能力基准,通过提取覆盖度量来构建。为解决衡量通用能力时涉及的无界范围问题,我们提出以演化动力学为灵感来有机地探索Xent博弈空间。
引用
@article{arxiv.2506.06832,
title = {Cross-Entropy Games for Language Models: From Implicit Knowledge to General Capability Measures},
author = {Clément Hongler and Andrew Emil},
journal= {arXiv preprint arXiv:2506.06832},
year = {2025}
}
备注
42 pages, 16 figures