中文

类AlphaZero智能体对对抗扰动的鲁棒性研究

人工智能 2022-11-08 v1 机器学习 机器人学

摘要

AlphaZero (AZ)的成功表明,基于神经网络的围棋AI可以大幅超越人类水平。鉴于围棋的状态空间极其庞大,且人类玩家可从任意合法状态对弈,我们探究是否存在针对围棋AI的对抗状态,使其走出令人惊讶的错误着法。本文首先将对抗样本的概念拓展至围棋:我们通过向对局中添加无意义的落子,生成与原始状态“语义”等价的扰动状态;而对抗状态是指导致明显劣着(即便围棋初学者也能看出)的扰动状态。然而,由于搜索空间庞大、离散且不可微,对抗状态的搜索极具挑战。为应对此挑战,我们开发了首个针对围棋AI的对抗攻击方法,能够通过策略性缩减搜索空间高效搜寻对抗状态。该方法也可推广至如禁围棋(NoGo)等其他棋盘游戏。实验上,我们表明策略-价值神经网络(PV-NN)与蒙特卡洛树搜索(MCTS)的着法均可被添加一或两颗无意义棋子所误导;例如,在58%的AlphaGo Zero自对弈棋局中,我们的方法可使广泛使用的KataGo智能体在50次MCTS模拟下因添加两颗无意义棋子而走出致败着法。我们还用业余人类围棋玩家评估了算法发现的对抗样本,其中90%的样本确实导致围棋AI走出明显劣着。我们的代码见 \url{https://PaperCode.cc/GoAttack}。

关键词

引用

@article{arxiv.2211.03769,
  title  = {Are AlphaZero-like Agents Robust to Adversarial Perturbations?},
  author = {Li-Cheng Lan and Huan Zhang and Ti-Rong Wu and Meng-Yu Tsai and I-Chen Wu and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2211.03769},
  year   = {2022}
}

备注

Accepted by Neurips 2022