中文

稀疏性是必要的:大动作空间中智能体LLM的多项式时间稳定性

人工智能 2026-01-14 v1

摘要

工具增强的LLM系统展现了一种学习理论在很大程度上忽略的控制机制:在巨大的离散动作空间(工具、API、文档)中进行序贯决策,其中只有一小部分未知子集与任何固定的任务分布相关。我们将此设置形式化为稀疏智能体控制(SAC),其中策略在M >> 1个动作上具有块稀疏表示,且奖励依赖于稀疏主效应和(可选)稀疏协同效应。我们通过凸代理研究1,2\ell_{1,2}正则化策略学习,并建立了清晰的压缩感知式结果:(i) 在策略RSC条件下,估计和值次优性按k(logM/T)1/2k (\log M / T)^{1/2}缩放;(ii) 当T>klogMT > k \log M且满足非相干性和beta-min条件时,通过原始-对偶见证论证可实现精确的工具支持恢复;(iii) 任何稠密策略类都需要Ω(M)\Omega(M)个样本,这解释了仅提示控制器的非稳定性。我们进一步证明,在部分可观测性下,LLM仅通过信念/表示误差ϵb\epsilon_b起作用,导致O(ϵb)O(\epsilon_b)的加性退化,同时保持对M的对数依赖。扩展内容涵盖了免调优、在线、鲁棒、组稀疏和交互感知的SAC。

关键词

引用

@article{arxiv.2601.08271,
  title  = {Sparsity Is Necessary: Polynomial-Time Stability for Agentic LLMs in Large Action Spaces},
  author = {Angshul Majumdar},
  journal= {arXiv preprint arXiv:2601.08271},
  year   = {2026}
}