中文

先验知识是可能的:从亚线性图算法到 LLM 测试时方法

机器学习 2026-05-19 v3 人工智能 计算复杂性 数据结构与算法

摘要

测试时增强,如检索增强生成(RAG)或工具使用,严重依赖于模型的可参数化知识与外部检索信息之间的相互作用。然而,这种关系的理论基础仍不充分了解。具体而言,尚不清楚在仅需少数增强步骤的情况下,模型需要多少预训练知识才能回答查询,这在实际中是理想的属性。为回答此问题,我们将多步推理形式化为知识图上的 ss-tt 连通问题。我们将模型的预训练可参数化知识表示为部分、可能是噪声的子图。我们将增强视为查询准确边以增强模型的知识。然后,我们 characterize 给定部分先验知识时,模型生成准确答案所需的增强步骤数。一个关键结果显示相位转变:如果包含 nn 个顶点的先验知识图被划分为小型组件,则通过增强寻找路径效率低下,需要 Ω(n)\Omega(\sqrt{n}) 查询;另一方面,一旦正确知识的密度超过阈值,形成巨型组件后,我们可以在期望常数数量的查询中找到路径。

关键词

引用

@article{arxiv.2510.16609,
  title  = {Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods},
  author = {Avrim Blum and Daniel Hsu and Cyrus Rashtchian and Donya Saless},
  journal= {arXiv preprint arXiv:2510.16609},
  year   = {2026}
}