中文

面向多任务离线强化学习的保守数据共享

机器学习 2021-09-17 v1 人工智能 机器人学

摘要

离线强化学习(RL)算法在拥有大量预收集数据的领域中已展现出有前景的结果。然而,先前方法侧重于利用离线数据集从零开始解决单个问题,而未考虑离线RL智能体如何获取多种技能。我们认为离线RL的一个自然用例是:可汇集各种场景下收集的大量数据以解决不同任务,并利用所有这些数据比孤立训练每个任务更有效地学习所有任务的行为。然而,在多任务离线RL中跨所有任务共享数据在实践中表现得出奇地差。通过详尽的实证分析,我们发现共享数据实际上会加剧所学策略与数据集之间的分布偏移,进而可能导致所学策略发散且性能不佳。为应对该挑战,我们开发了一种用于多任务离线RL中数据共享的简单技术,其基于相对于任务特定数据的改进来路由数据。我们称此方法为保守数据共享(CDS),它可应用于多种单任务离线RL方法。在一系列具有挑战性的多任务运动、导航以及基于视觉的机器人操作问题上,CDS相比先前的离线多任务RL方法与以往数据共享方法取得了最佳或相当的性能。

关键词

引用

@article{arxiv.2109.08128,
  title  = {Conservative Data Sharing for Multi-Task Offline Reinforcement Learning},
  author = {Tianhe Yu and Aviral Kumar and Yevgen Chebotar and Karol Hausman and Sergey Levine and Chelsea Finn},
  journal= {arXiv preprint arXiv:2109.08128},
  year   = {2021}
}