超越奖励抑制:通过动态表示电路中断构建 MARL 中的隐写通信协议
摘要
在去中心化的多智能体强化学习 (MARL) 中,隐写联合——即智能体开发私有协议以规避监控——构成了临界人工智能安全威胁。现有防御仅限于行为或奖励层面,无法检测潜在通信通道中的协调。我们引入动态表示电路中断器 (DRCB),一种 operate at 优化基质上的架构防御。基于 AI 母语 (AIM) 框架,DRCB 使用向量量化变分自编码器 (VQ-VAE) 瓶颈将不可观测消息转换为可审计的统计对象。DRCB 监控包括 Jensen-Shannon 散度漂移、L2-范数码本位移和随机化观察者池准确率等信号,以计算基于指数移动平均的联合得分。阈值触发四个 escalate intervention:动态适应、注入梯度空间惩罚进入价值函数 A^pi、时间奖励抑制,以及通过码本混洗和优化器状态重置实现完整基质电路中断。在带有 MNIST 标签的情境囚禁困境中,静态监控失败 (p = 0.3517),而 DRCB 将观察者平均准确率提高 from 0.858 to 0.938 (+9.3 percent),并降低波动性 43 percent,同时保持平均联合奖励 (p = 0.854)。对 214,298 个符号样本的分析确认“语义退化”,即高频序列收敛于零熵,阻止复杂隐写编码。我们识别出“透明悖论”,即智能体在实现表面层确定性的同时,仍保留长尾分布中的残余能力,这反映了 Goodhart 定律。该任务无关的方法为 MICA 合规 (Multi-Agent Internal Coupling Audit) 的部署前审计提供了技术路径。
引用
@article{arxiv.2603.15655,
title = {Beyond Reward Suppression: Reshaping Steganographic Communication Protocols in MARL via Dynamic Representational Circuit Breaking},
author = {Liu Hung Ming},
journal= {arXiv preprint arXiv:2603.15655},
year = {2026}
}
备注
38 pages, includes 5 figures and 8 tables, preliminary version, AI safety / multi-agent reinforcement learning