FAST-Q:针对离线强化学习中的反事实动作估计引入对抗性平衡状态表示的快速探索
机器学习
2025-05-01 v1 人工智能
摘要
近期在状态空间(SOTA)离线强化学习(RL)中取得的进展主要聚焦于解决函数逼近误差,这类误差导致对超分布动作的 Q 值被高估,静态数据集加剧了这一挑战。然而,高风险应用如在线游戏中的推荐系统,因玩家心理(意图)受游戏体验驱动以及平台内在波动性,进一步增加了复杂性。这些因素导致状态空间高度稀疏、部分重叠,并受实验路径选择逻辑影响,使之倾向于特定策略。当前 SOTA 方法通过裁剪已知的反事实动作作为超分布动作来限制从此类离线数据中学习,由于在未观察状态上的泛化能力差。进一步恶化了保守 Q 学习,迫使更多在线探索。FAST-Q 引入新方法:(1)利用梯度反转学习构建平衡的状态表示,正规化玩家状态与动作之间的策略特定偏差,从而实现反事实估计;(2)支持静态数据利用与离线反事实探索并行;(3)提出 Q 值分解策略,用于多目标优化,促进基于短期与长期目标的可解释推荐。这些创新表明 FAST-Q 在先前 SOTA 方法之上具有优势,至少在玩家收益上提升 0.15 百分比,在终身价值(LTV)上提升 2 百分比,在基于推荐的参与度提升 0.4 百分比,在玩家平台停留时间提升 2 百分比,并在推荐成本上实现惊人的 10 百分比降低,均在不稳定的游戏平台上取得。
引用
@article{arxiv.2504.21383,
title = {FAST-Q: Fast-track Exploration with Adversarially Balanced State Representations for Counterfactual Action Estimation in Offline Reinforcement Learning},
author = {Pulkit Agrawal and Rukma Talwadker and Aditya Pareek and Tridib Mukherjee},
journal= {arXiv preprint arXiv:2504.21383},
year = {2025}
}