VAM:基于语言模型后训练的可控探索中的言语化动作掩码——棋局案例研究
机器学习
2026-02-20 v1 人工智能
摘要
在大语言模型(LLM)的强化学习后训练中,稀疏反馈和大型动作空间常导致模型过早陷入重复行为,从而成为关键瓶颈。我们提出 Verbalized Action Masking(VAM),通过语言化动作掩码实现可控探索。该方法在提示中语言化动作掩码,并强制模型输出掩码集合中的动作。基于此接口,我们引入迭代动作空间修剪:若未采样目标动作,则从掩码中移除有效采样动作并在缩小后的候选集下重新采样,重复直到目标被采样或预算耗尽。我们在棋局中研究VAM,评估两种训练模式:一种通过对抗引擎对弈生成状态的engine-play模式;另一种基于带有验证器评分的固定数据集训练的fixed-dataset模式。在稳定性较差的棋局谜题和完整棋局中,以平均分数损失(ACPL)为指标,VAM在学习效率和最终性能上优于强基准,凸显言语化掩码是LLM后训练中可控探索的实用机制。
引用
@article{arxiv.2602.16833,
title = {VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study},
author = {Zhicheng Zhang and Ziyan Wang and Yali Du and Fei Fang},
journal= {arXiv preprint arXiv:2602.16833},
year = {2026}
}