中文

基于 VLM-TO-IRL 的奖励驱动的电子竞技选手筛选

机器学习 2026-04-17 v1

摘要

传统电子竞技选手筛选工作流程高度依赖手动视频审查和综合绩效指标,这些方法往往难以捕捉决定某位潜力选手是否符合特定战术类型所必需的细微决策模式。为此,我们将电子竞技中基于风格的选手评估重新框定为逆向强化学习 (IRL) 问题。本文引入一种新型选手筛选框架,通过从已记录的游戏演示中学习专业人士专属的奖励函数,使组织能够依据候选选手与目标明星选手的风格一致性进行排名。我们的框架采用多模态双支路结构:一支支路编码由高分辨率游戏遥测数据派生的结构化状态-动作轨迹,另一支支路编码由视觉-语言模型 (VLM) 从播出 footage 中生成的临时对齐式战术伪评论。这些表示被融合并通过生成对抗式模仿学习 (GAIL) 目标进行评估,其中判别器学习捕捉精英职业人士独有的机械与战术特征。通过从通用技能估计转向“按奖励筛选”,该框架提供了一个可扩展、工作流程感知的数字孪生系统,使数据驱动的阵容构建和针对性人才发现在大规模候选人库中成为可能。

关键词

引用

@article{arxiv.2604.14474,
  title  = {Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports},
  author = {Qing Yan and Wenyu Yang and Yufei Wang and Wenhao Ma and Linchong Hu and Yifei Jin and Anton Dahbura},
  journal= {arXiv preprint arXiv:2604.14474},
  year   = {2026}
}