可切换轻量级反对称处理(SLAP)结合 CNN 以更小样本超越数据增强——在五子棋强化学习中的应用
机器学习
2023-05-17 v5 人工智能
计算机视觉与模式识别
摘要
为替代数据增强,本文提出一种称为 SLAP 的方法,以强化经验来加速机器学习并减小样本量。SLAP 是一种模型无关的协议/函数,针对不同的变换变体产生相同输出。在五子棋棋局状态的实验中,SLAP 将卷积神经网络学习的收敛速度提升了 83%,且仅使用数据增强八分之一的样本量。在五子棋强化学习中,以采用数据增强的 AlphaGo Zero/AlphaZero 算法为基线,SLAP 将训练样本数减少为 1/8,并对同一评估器取得相似胜率,但尚无明显证据表明其能加速强化学习。该益处至少应适用于对对称性或某些变换不变的定义域。作为未来工作,SLAP 或可辅助那些不对对称性不变的定义域实现更具可解释性的学习与迁移学习,作为迈向通用人工智能的一小步。
引用
@article{arxiv.2301.04746,
title = {Switchable Lightweight Anti-symmetric Processing (SLAP) with CNN Outspeeds Data Augmentation by Smaller Sample -- Application in Gomoku Reinforcement Learning},
author = {Chi-Hang Suen and Eduardo Alonso},
journal= {arXiv preprint arXiv:2301.04746},
year = {2023}
}
备注
In Berndt M\"uller (Ed.), Proceedings of AISB Convention 2023 (pp. 69-75). AISB