基于强化学习的竞技在线视频游戏中高效毒性检测
机器学习
2025-03-28 v1
摘要
在线平台致力于主动检测和应对不良行为,旨在将资源密集型的监控集中于此类行为最常见的领域。本文考察了在竞技在线视频游戏中进行高效毒性检测的抽样问题。为做出最优监控决策,视频游戏服务运营商需要估计毒性行为的概率。如果没有用于预测的模型,必须实时估计。在此背景下,我们提出一种情境式多臂老虎机算法,基于据领域专家知识与毒性行为相关的少数变量进行监控决策。该算法在探索与利用之间进行平衡,以优化长期结果,专为轻松部署在生产环境中而设计。利用来自流行的第一人称动作游戏《使命召唤:现代战争III》的数据,我们展示了该算法持续优于仅依赖玩家过去行为的基准算法。这一发现对毒性的本质具有实质性含义,也说明了如何运用领域专家知识帮助视频游戏服务运营商识别和缓解毒性,从而营造更安全、更愉悦的游戏体验。
引用
@article{arxiv.2503.20968,
title = {Reinforcement Learning for Efficient Toxicity Detection in Competitive Online Video Games},
author = {Jacob Morrier and Rafal Kocielnik and R. Michael Alvarez},
journal= {arXiv preprint arXiv:2503.20968},
year = {2025}
}