用于完成新任务的任务无关学习
人工智能
2025-04-29 v3
摘要
近年来,强化学习(RL)和模仿学习(IL)在机器人决策方面取得了巨大进展。然而,这些方法在需要通过动作新组合来完成的新任务上表现出明显的退化。RL 方法受困于奖励函数与分布偏移,而 IL 方法受限于未涵盖新任务的专家演示。相比之下,人类可以利用从任务无关经验中习得的碎片化知识轻松完成这些任务。受此启发,本文提出一种任务无关学习方法(简称 TAL),该方法仅从任务无关数据中学习碎片化知识以完成新任务。TAL 包含四个阶段。首先,执行任务无关探索,通过与环境的互动收集数据,并利用知识图谱对收集的数据进行组织。其次,提出一种动作特征提取器,并使用所收集的知识图谱数据进行训练,以实现任务无关的碎片化知识学习。第三,设计候选动作生成器,将动作特征提取器应用于新任务以生成多个候选动作集。最后,设计动作提议网络,根据环境信息为新任务中的动作产生概率。随后利用这些概率生成顺序信息,用于从多个候选动作集中选择要执行的动作以形成计划。在虚拟室内场景上的实验表明,所提方法优于最先进的离线 RL 方法和 IL 方法 20% 以上。
引用
@article{arxiv.2209.04100,
title = {Task-Agnostic Learning to Accomplish New Tasks},
author = {Xianqi Zhang and Xingtao Wang and Xu Liu and Wenrui Wang and Xiaopeng Fan and Debin Zhao},
journal= {arXiv preprint arXiv:2209.04100},
year = {2025}
}
备注
14 pages, 10 figures, Accepted by IEEE-TCDS