解释、学习与共情作为单一约束:一种带可解释停更的残差充足架构
神经元与认知
2026-05-26 v1 人工智能
多智能体系统
摘要
智能体必须对当前情境进行行动、学习其尚无法表示的内容、并足够建模其他智能体以实现协调。这三种能力通常由独立的机制实现,但它们共享一种失败模式:情境可能超出智能体当前能表示的范围,此时诚实的响应是一种原则性的拒绝,说明缺失了什么。我们发展了一个小型认知架构,其中这些限制源于单个量值。解释-决策单元(IDU)通过一族制度——具有私有基的局部表示框架——来解释内容向量并决定授权的行动;对内容相对于活跃制度表示范围的残差驱动该单元。残差较低且授权清晰时发出行动;否则,单元重新解释、尝试描述长度合理的扩张,或以带类型、见证的终止方式停止。我们证明该单元是全且确定的:对于任意内容和固定配置,单位在有限的有界成本步骤内以唯一的终止见证停止,因此停更带有其原因。通过在不改变机制的前提下绑定架构的开放参数,相同的残差-范围约束在三个层级上恢复三种已记录现象:不知道的类型分类(带类型的停更);智能体之间的误解(局限于一个共享概念且对实施者不可见);以及从受限注意力窗口而非假设的学习先决条件。每个实例均为自然代理人和人工代理人所检验,并表述可检验的预测,因此该单一约束可以建模人类和机器认知中的限制。该模型贡献了统一性和一种可解释停更概念,由构造方式保证其带类型和见证。
引用
@article{arxiv.2605.24999,
title = {Interpretation, Learning, and Empathy as One Constraint: A Residual-Adequacy Architecture with Accountable Abstention},
author = {Chainarong Amornbunchornvej},
journal= {arXiv preprint arXiv:2605.24999},
year = {2026}
}
备注
First draft for journal submission. The code is at https://github.com/DarkEyes/RC-Arch