中文

深度神经网络中潜在智能体子结构的概率建模

机器学习 2026-05-13 v2 人工智能

摘要

我们为神经模型发展了一套基于概率建模的智能体理论。智能体被表示为以对数分数给出认知效用的结果分布,其组合通过加权对数池化定义,从而严格改善每个成员的福利。我们证明了在线性池化或二元结果空间下不可能实现严格一致,但在三个或更多结果下是可能的。我们的框架通过克隆不变性、连续性和开放性允许递归结构,同时基于倾斜的分析排除了平凡的复制。最后,我们利用我们的理论形式化了 LLM 中的智能体对齐现象:诱导一个仁慈的角色(“Luigi”)会引发一个对立的对应角色(“Waluigi”),而“先显现后抑制 Waluigi”的策略比仅使用纯 Luigi 强化能产生严格更大的一阶失配减少。这些结果阐明了,为子智能体如何融合成连贯的高层实体建立有原则的数学框架,为智能体 AI 系统的对齐提供了新的启示。

关键词

引用

@article{arxiv.2509.06701,
  title  = {Probabilistic Modeling of Latent Agentic Substructures in Deep Neural Networks},
  author = {Su Hyeong Lee and Risi Kondor and Richard Ngo},
  journal= {arXiv preprint arXiv:2509.06701},
  year   = {2026}
}

备注

Accepted by ICML 2026