中文

通过可微内部对齐嵌入实现嵌入式安全对齐智能

机器学习 2025-12-23 v1 人工智能

摘要

我们提出嵌入式安全对齐智能(ESAI),这是一种用于多主体强化学习的理论框架,通过可微内部对齐嵌入将对齐约束嵌入代理的内部表示中。不同于外部奖励塑形或事后安全约束,内部对齐嵌入是通过反事实推理预测外部化伤害的学习型潜在变量,并通过注意力和图基传播调制策略更新以实现伤害减少。ESAI框架集成了四种机制:从软参考分布计算的可微反事实对齐惩罚,对齐加权感知注意力,支持时间信用分配的赫布式关联记忆,以及带有偏差缓解控制的相似度加权图扩散。我们分析了在Lipschitz连续性和谱约束下有界内部嵌入的稳定性条件,讨论了计算复杂度,并检讨了理论属性包括收缩行为和公平性-性能权衡。该工作将ESAI定位为多主体系统中可微对齐机制的概念性贡献。我们指出了关于收敛保证、嵌入维度以及扩展到高维环境的开放理论问题。经验评估留给未来工作。

关键词

引用

@article{arxiv.2512.18309,
  title  = {Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings},
  author = {Harsh Rathva and Ojas Srivastava and Pruthwik Mishra},
  journal= {arXiv preprint arXiv:2512.18309},
  year   = {2025}
}

备注

32 pages, 1 figure. Theoretical framework; no empirical results