中文

规模行为推断:动机与信念系统之间的根本性不对称

多智能体系统 2026-03-10 v2 机器学习

摘要

我们通过大规模受控实验,对行为推断设定经验界限:LLM-based智能体分配其中一种36种行为轮廓(9种信念系统×4种动机),在网格世界环境中生成超过150万个行为序列,提供了人类行为研究中难以获得的真实数据。我们不问行为推断是否存在限制,而是问这些限制有多大、集中在哪里、以及为何如此。在magnitude和structure两方面都出现了根本性的不对称。动机实现98-100%的推断准确率,并在所有架构中恢复97%的可用相互信息。信念系统在LSTM上 plateau at 24%,仅恢复30%的可用信息,这是信息提取效率的3.3倍不对称。具有9阶段课程学习的Transformer架构达到49%的对齐准确率,翻倍了LSTM的性能,表明循环的底限是架构性的而非根本性的。即便如此,这一改进仍使信念系统正确分类不到一半,按对齐准确率从1%(True Neutral)到72%(Lawful Evil)不等。混淆分析精确映射了故障结构:一个“中性区”的行为模糊性 extends beyond True Neutral,涵盖Good alignments,在这里,利他行为与规则遵循或平衡保持行为不可区分。结合动机和信念推断可为完整的36类轮廓分类带来17.6倍于随机基线的改进,同时确立瓶颈完全位于信念系统推断中。信号增强和解释查询仅带来微小的LSTM收益(+3.8%),确认底限是信息论性的而非数据受限的。这些界限直接影响任何依赖行为监控来推断agent价值的系统。

关键词

引用

@article{arxiv.2509.05624,
  title  = {Behavioral Inference at Scale: The Fundamental Asymmetry Between Motivations and Belief Systems},
  author = {Jason Starace and Terence Soule},
  journal= {arXiv preprint arXiv:2509.05624},
  year   = {2026}
}