效用之前的可能性:学习并使用分层可供性
机器学习
2022-03-25 v1 人工智能
神经与进化计算
机器学习
摘要
强化学习算法在具有复杂分层依赖结构的任务上表现不佳。人类和其他智能体不会浪费时间评估每一个存在的高层动作的效用,而是首先只考虑那些他们认为可能的动作。通过仅关注当下可行或“可供”的事物,智能体可以花更多时间评估真正重要事物的效用并采取行动。为此,我们提出分层可供性学习(HAL),一种学习分层可供性模型以剪枝不可能子任务从而实现更高效学习的方法。现有的分层强化学习工作为智能体提供了子任务的结构化表示,但不具备可供性感知;而通过将我们的分层可供性定义立足于当前状态,我们的方法比大量将子任务依赖建立在符号历史之上的方法更为灵活。这些基于逻辑的方法通常需要子任务层次的完整知识,而我们的方法能够利用不完整且变化的符号规范。此外,我们证明,相对于不具备可供性感知的方法,HAL 智能体能够更高效地学习复杂任务、应对环境随机性,并在缺乏外在监督时习得多样化技能——这些都是人类学习的标志。
引用
@article{arxiv.2203.12686,
title = {Possibility Before Utility: Learning And Using Hierarchical Affordances},
author = {Robby Costales and Shariq Iqbal and Fei Sha},
journal= {arXiv preprint arXiv:2203.12686},
year = {2022}
}
备注
ICLR 2022 camera-ready