通过视觉辅助聚类排序实现时间高效的奖励学习
机器学习
2022-12-02 v1 人机交互
摘要
奖励学习最成功的范式之一是使用以比较形式的人类反馈。尽管这些方法前景广阔,但人工比较标注昂贵且耗时,构成了其更广泛适用性的主要瓶颈。我们的洞察是,通过将比较批量处理,而不是让人工单独标注每个比较,我们可以极大地提高这些方法中人工时间的使用效率。为此,我们利用数据降维和可视化技术,为人工提供一个显示状态空间的交互式 GUI,用户可以在其中标注状态空间的子部分。在一些简单的 Mujoco 任务中,我们表明这种高阶方法具有前景,并且在给定相同人工标注时间的情况下,能够极大地提高最终智能体的性能。
引用
@article{arxiv.2212.00169,
title = {Time-Efficient Reward Learning via Visually Assisted Cluster Ranking},
author = {David Zhang and Micah Carroll and Andreea Bobu and Anca Dragan},
journal= {arXiv preprint arXiv:2212.00169},
year = {2022}
}
备注
Presented at the NeurIPS 2022 Human in the Loop Learning (HiLL) Workshop