中文

强化学习与模仿学习在顺序任务中的内在动机

人工智能 2024-12-31 v1 人机交互 机器学习 机器人学

摘要

本文旨在构建一个连接强化学习与模仿学习的新领域,提出一种用于学习代理(agent)的内在动机模型,使其能够获得来自教练者对多个任务(包括顺序任务)的指导。主要贡献在于提出一种基于经验进展的内在动机通用表述,使学习代理能够自动选择其学习课程,通过主动选择学习策略来学习简单或顺序任务:选择学习哪个任务、在自主探索与模仿学习之间选择、在低级动作与任务分解之间选择、在多个教练者之间选择。原创性在于设计一种受教练者指导的学习器,既被动利用教练者提供的数据,又能主动选择何时请求教学以及向何人、请求什么样的帮助。因此,该学习器对教学质量更具鲁棒性,能够通过更少的演示更快地学习。我们发展了基于机器学习算法的社会引导型内在动机框架,能够通过利用人类演示的普遍性质,以被动或主动方式(通过请求来自简单子任务和组合子任务中最佳教练者的演示)来学习多个任务。后者依赖于一种用于构建过程的子任务组合表征,需通过分析人类运动和日常活动观察过程的表征进行细化。展望可与教练者进行类语言交流,我们研究了在内在动机驱动下,连续感知运动空间和任务的符号表征的涌现。我们提出在强化学习框架内,一种用于与教练者交互以实现多任务学习中自动课程学习的奖励函数。

关键词

引用

@article{arxiv.2412.20573,
  title  = {The intrinsic motivation of reinforcement and imitation learning for sequential tasks},
  author = {Sao Mai Nguyen},
  journal= {arXiv preprint arXiv:2412.20573},
  year   = {2024}
}

备注

Habilitation thesis