中文

基于对抗对齐雅可比正则化的智能体 AI 系统鲁棒性

机器学习 2026-03-05 v1 人工智能 密码学与安全 多智能体系统

摘要

随着大语言模型(LLM)向自主多智能体生态系统迈出,鲁棒的极小极大训练至关重要,但当高度非线性策略导致内层最大化中的极端局部曲率时,标准做法往往不够稳定。采用全局雅可比边界约束的常规补救措施过于保守,抑制了所有方向上的灵敏度,导致鲁棒性价格大幅上升。我们引入对抗对齐雅可比正则化(Adversarially-Aligned Jacobian Regularization, AAJR),这是一种沿对抗升力方向控制灵敏度的轨迹对齐方法。我们证明,在温和条件下,AAJR 所允许的策略类严格大于全局约束,暗示其近似间隙更小且正式性能衰减更少。此外,我们推导了AAJR 控制优化轨迹沿有效光滑性并确保内层稳定性的步长条件。这些结果为解构智能体鲁棒性的结构理论提供了依据,使极小极大训练的稳定性得以脱离全局表达性限制。

关键词

引用

@article{arxiv.2603.04378,
  title  = {Robustness of Agentic AI Systems via Adversarially-Aligned Jacobian Regularization},
  author = {Furkan Mumcu and Yasin Yilmaz},
  journal= {arXiv preprint arXiv:2603.04378},
  year   = {2026}
}