中文

识别用于无监督子任务发现的选择变量

机器学习 2024-10-30 v1 人工智能 机器人学

摘要

在解决长视野任务时,将高级任务分解为子任务引人入胜。将经验分解为可复用的子任务可以提高数据效率,加速策略泛化,并总体上为多任务强化学习和模仿学习问题提供有前景的解决方案。然而,子任务的概念尚未得到充分理解和建模,现有工作通常忽略了数据生成过程的真实结构:子任务是动作上的一种选择\textit{选择}机制的结果,而非可能的潜在混杂因素或中间变量。具体而言,我们提供了识别此类数据中选择变量的理论,并进行了实验验证。这些选择作为指示子任务并指导策略的子目标。基于这一想法,我们开发了一种序列非负矩阵分解方法来学习这些子目标,并提取有意义的行为模式作为子任务。我们在具有挑战性的Kitchen环境中的实证结果表明,学习到的子任务在多任务模仿学习场景中有效增强了对新任务的泛化能力。代码提供于 https://anonymous.4open.science/r/Identifying\_Selections\_for\_Unsupervised\_Subtask\_Discovery/README.md。

关键词

引用

@article{arxiv.2410.21616,
  title  = {Identifying Selections for Unsupervised Subtask Discovery},
  author = {Yiwen Qiu and Yujia Zheng and Kun Zhang},
  journal= {arXiv preprint arXiv:2410.21616},
  year   = {2024}
}

备注

NeurIPS 2024