建模人类理性水平对从多种反馈类型学习奖励的影响
机器学习
2023-03-10 v2 人工智能
摘要
在从人类行为(无论是演示、比较、物理纠正还是紧急停止)推断奖励函数时,将人类建模为做出噪声理性选择已被证明是有用的,其中“理性系数”捕捉我们预期在人类行为中看到的噪声或熵的量。先前的工作通常将理性水平设为常数值,而不管人类反馈的类型或质量。然而,在许多场景中,给出一种反馈(例如演示)可能比另一种反馈(例如回答比较查询)困难得多。因此,我们预期会根据人类反馈的类型看到或多或少的噪声。本工作中,我们主张将理性系数基于每种反馈类型的真实数据,而非假设默认值,这对奖励学习有显著的积极影响。我们在模拟实验和带有真实人类反馈的用户研究中对此进行了测试。我们发现,高估人类理性会对奖励学习精度和 regret 产生严重后果。我们还发现,将理性系数拟合到人类数据可实现更好的奖励学习,即使人类因系统性偏差显著偏离噪声理性选择模型。此外,我们发现理性水平影响每种反馈类型的信息量:令人惊讶的是,演示并非总是信息量最大的——当人类行为非常次优时,即使两者理性水平相同,比较实际上变得更具信息量。最终,我们的结果强调了关注所假设的人类理性水平的重要性与优势,尤其是当智能体从多种类型的人类反馈主动学习时。
引用
@article{arxiv.2208.10687,
title = {The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types},
author = {Gaurav R. Ghosal and Matthew Zurek and Daniel S. Brown and Anca D. Dragan},
journal= {arXiv preprint arXiv:2208.10687},
year = {2023}
}
备注
Published at AAAI 2023; 10 pages, 5 figures plus appendices