通过社会交互与好奇心驱动的多目标学习实现语言落地
机器学习
2019-11-11 v1 计算与语言
机器学习
摘要
自主强化学习智能体如同儿童一样,无法获得预定义的目标与奖励函数。它们必须发现潜在目标、学习自身的奖励函数并走上自己的学习轨迹。然而,儿童受益于语言暴露,有助于组织和调节其思维。我们提出 LE2(Language Enhanced Exploration,语言增强探索),一种利用内在动机与描述性社会伙伴(SP)进行自然语言(NL)交互的学习算法。利用来自 SP 的 NL 描述,它可学习一个 NL 条件的奖励函数,以为内在动机驱动的目标探索制定目标,并学习一个目标条件策略。通过探索、收集来自 SP 的描述并联合学习奖励函数与策略,智能体将 NL 描述落地为真实行为目标。从早期发现的简单目标到通过在更简单目标上实验而发现的更复杂目标,我们的智能体自主构建自身的行为库。这一自然发生的课程由智能体内在动机所产生的主动学习课程加以补充。我们给出了一个与若干物体(包括工具)交互的模拟机械臂的实验。
引用
@article{arxiv.1911.03219,
title = {Language Grounding through Social Interactions and Curiosity-Driven Multi-Goal Learning},
author = {Nicolas Lair and Cédric Colas and Rémy Portelas and Jean-Michel Dussoux and Peter Ford Dominey and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:1911.03219},
year = {2019}
}
备注
NeurIPS 2019 Workshop ViGIL : Visually Grounded Interaction and Language