基于 Oracle 的软盾牌以实现棋局安全决策
机器学习
2026-03-10 v1 人工智能
摘要
在高风险环境中,依赖纯模仿学习或强化学习的智能体在探索过程中常难以避免安全关键错误。现有的强化学习方法(如棋类)需数十万回合并耗费大量计算资源才能收敛。相比之下,模仿学习更具样本效率,但在分布迁移下脆弱且缺乏主动风险规避机制。本文提出 Oracle-Guided Soft Shielding(OGSS),一种简单而有效的框架,用于更安全的决策,使智能体能够在模仿学习环境中从 Oracle 反馈中学习概率安全模型,从而实现安全探索。我们聚焦棋类领域,训练模型基于历史棋局预测强力着法,同时独立学习基于 Stockfish 评估的误杀预测模型以估计每步着法的战术风险。在推理阶段,智能体首先生成候选着法集合,然后利用误杀模型确定高风险选项,随后结合策略模型预测的着法概率与误杀概率,通过效用函数选择在性能与安全性之间取得平衡的行动。此举使智能体能够在显著降低战术错误概率的同时探索并进行竞技对弈。在数百局对弈中,我们与文献中的其他方法(如动作修剪、SafeDAgger、基于不确定性的抽样)进行比较。结果表明,OGSS 变体即使在探索比率提升数倍后,仍保持较低的误杀率,凸显其支持更广泛探索而不牺牲战术安全性的能力。
引用
@article{arxiv.2603.08506,
title = {Oracle-Guided Soft Shielding for Safe Move Prediction in Chess},
author = {Prajit T Rajendran and Fabio Arnez and Huascar Espinoza and Agnes Delaborde and Chokri Mraidha},
journal= {arXiv preprint arXiv:2603.08506},
year = {2026}
}
备注
Accepted for publication at the 24th International Conference on Machine Learning and Applications (ICMLA), 2025. Preprint version in Arxiv