中文

characterizing Robustness of Strategies to Novelty in Zero-Sum Open Worlds

计算机科学与博弈论 2026-02-17 v1

摘要

在开放世界环境中,人工智能体必须应对与训练或设计假设相背离的新情况。本文聚焦于两人零和游戏中的固定策略智能体对此类 novelty 的鲁棒性。我们提出了一种通用框架,用于刻画环境 novelty(例如 payoff 结构或 action 约束的变化)对智能体性能的影响,分别适用于 Iterated Prisoner's Dilemma(IPD)和扑克牌中的德州扑克。 novelty 通过扰动游戏规则或计分机制来实现,而智能体行为保持不变。为衡量其影响,我们引入了两个指标:每个智能体的鲁棒性(衡量每个策略在不同 novelty 之间的相对性能变化)和全局影响(总结 novelty 对整个群体的干扰程度)。我们的实验包括 30 个 IPD 智能体跨 20 种 payoff 矩阵 novelty,以及 10 个扑克智能体跨 5 种规则性 novelty,揭示了鲁棒性的系统性模式,并指出了某些 novelty 可导致严重的不稳定。结果为在扰动下评估智能体的通用性提供了洞见,并为在对抗和动态环境中设计更安全、更具韧性的自主系统提供了量化依据。

关键词

引用

@article{arxiv.2602.14278,
  title  = {Characterizing Robustness of Strategies to Novelty in Zero-Sum Open Worlds},
  author = {Mayank Kejriwal and Shilpa Thomas and Hongyu Li},
  journal= {arXiv preprint arXiv:2602.14278},
  year   = {2026}
}

备注

25 pages, 10 tables, 15 figures