来自多位教师的主动奖励学习
机器学习
2023-03-03 v1 人工智能
摘要
奖励学习算法利用人类反馈来推断奖励函数,随后用于训练 AI 系统。这种人类反馈通常是一种偏好比较,即人类教师比较若干 AI 行为样本,并选择其认为最能达成目标的样本。尽管奖励学习通常假设所有反馈来自单一教师,实践中这些系统常查询多位教师以收集充足的训练数据。本文研究这一差异,发现对这些不同反馈来源的算法化评估有助于更准确、更高效的奖励学习。我们形式化分析了当教师理性程度不同时进行奖励学习的价值信息(VOI),并定义并评估了一种利用该 VOI 主动选择待查询教师以获取反馈的算法。令人惊讶的是,我们发现查询相对非理性的教师往往信息量更大。通过形式化该问题并推导解析解,我们希望促进奖励学习方法在使 AI 行为与人类价值对齐方面的改进。
引用
@article{arxiv.2303.00894,
title = {Active Reward Learning from Multiple Teachers},
author = {Peter Barnett and Rachel Freedman and Justin Svegliato and Stuart Russell},
journal= {arXiv preprint arXiv:2303.00894},
year = {2023}
}