机械良知:机器智能可靠性的数学框架
人工智能
2026-05-06 v1
摘要
分布式协同智能(DCI)涵盖边到边架构、联邦学习、迁移学习和群体系统,其创造的环境在结构上不可避免地会产生涌现风险:在不确定性下,个体智能体局部正确的决策会组合成全局不可接受的行为轨迹。现有方法如约束优化、安全强化学习和运行时保障在个体动作层面而非行为轨迹层面评估可接受性,且均未涉及 DCI 部署的多参与者和充满不确定性的本质。本文引入了机械良知(MC),这是一个新颖的概念和简化的数学框架,将轨迹层面的规范调节操作化,适用于单智能体和分布式智能系统。机械良知被定义为一个监督滤波器,它对基线策略的动作进行最小程度的修正,以减少与规范允许区域的累积偏差,同时考虑认知不确定性。我们引入了相关的构造——良知分数、机械内疚和共振可靠性——为这一新兴领域提供了可解释的词汇和可计算的治理信号。我们确立了核心理论性质:容许等价性、最优调节的存在性以及单调偏差递减。说明性结果表明,在传统控制器漂移出允许边界的情况下,受 MC 调节的智能体仍能保持轨迹层面的规范可接受性,并且该框架能自然地扩展以抑制多智能体 DCI 环境中由交互引发的涌现风险。
引用
@article{arxiv.2605.03847,
title = {Mechanical Conscience: A Mathematical Framework for Dependability of Machine Intelligenc},
author = {Munkhdegerekh Batzorig and Purevbaatar Ganbold and Kyungbin Park and Pilkong Jeong and Kangbin},
journal= {arXiv preprint arXiv:2605.03847},
year = {2026}
}
备注
9 pages, 2 figures. Preprint