中文

机器人任务中通过随机策略衡量任务复杂度的局限性

机器学习 2026-02-24 v1

摘要

强化学习(RL)已在机器人和自然语言处理等领域取得重大进展。衡量任务复杂度是RL中的一个关键挑战,这对于创建有意义的基准和设计有效课程 curricula至关重要。虽然在表格化设置中已有众多成熟的指标来评估任务复杂度,但在非表格化域中则相对少见。这些包括(i)通过随机权重猜测(Random Weight Guessing, RWG)对随机策略性能的统计分析,以及(ii)信息论指标策略信息容量(Policy Information Capacity, PIC)和策略最优信息容量(Policy-Optimal Information Capacity, POIC),后者依赖于RWG。本文使用逐步难度递增的机器人操作设置进行评估,这些设置已知具有相对复杂度,且采用稠密奖励和稀疏奖励两种形式。我们的实证结果表明,衡量复杂度仍然比较细致。在相同的奖励形式下,PIC表明两杆机器人臂的设置比单杆设置更简单——这与机器人控制和经验RL视角相矛盾,后者认为两杆设置本质上更复杂。同样的设置下,POIC估计稀疏奖励的任务比稠密奖励的任务更简单。因此,我们表明PIC和POIC都与RL中的常规理解和实证结果相矛盾。这些发现凸显了超越RWG基指标的必要性,以便更可靠地捕捉非表格化RL中任务复杂度,本文的任务框架可作为新的起点。

关键词

引用

@article{arxiv.2602.18856,
  title  = {Issues with Measuring Task Complexity via Random Policies in Robotic Tasks},
  author = {Reabetswe M. Nkhumise and Mohamed S. Talamali and Aditya Gilra},
  journal= {arXiv preprint arXiv:2602.18856},
  year   = {2026}
}

备注

16 pages, 9 figures, The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)