中文

主动推断代理体系化建模、指标与收敛性评估

机器学习 2026-03-24 v1

摘要

本文针对AI安全中的核心挑战——mesa优化问题,提供了代理体系的形式化定义与分析框架。将代理概念化为一种通过动态平衡实现自组织的连续经验表征:好奇心(最小化预测误差以确保非可计算性和新颖性)与授权(最大化控制信道信息容量以确保主体性和目标导向性)之间的平衡。经验证据表明,这一主动推断模型成功地解释了经典工具性目标,如自我保存和资源获取。分析表明,提出的代理函数光滑且凸,具有良好的优化属性。尽管代理函数在总抽象函数空间中占据极小比例,但其在稀疏环境中表现出对数收敛,表明在训练现代大规模模型时,代理的自然出现概率很高。为量化代理程度,本文引入了基于给定系统行为等价物与空间内理想代理函数(STARC)之间距离的指标。这一形式化提供了一种具体工具,用于通过测度其接近理想代理目标的程度来分类和检测mesa优化器,为分析和识别复杂AI系统中的不良内部优化提供了稳健的手段。

关键词

引用

@article{arxiv.2603.21319,
  title  = {Active Inference Agency Formalization, Metrics, and Convergence Assessments},
  author = {Eduard Kapelko},
  journal= {arXiv preprint arXiv:2603.21319},
  year   = {2026}
}