人类并非玻尔兹曼分布:强化学习中人类反馈与交互建模的挑战与机遇
机器学习
2022-06-28 v1 人机交互
机器学习
摘要
强化学习(RL)通常假设可获取明确指定的奖励函数,而许多实际应用并不提供此类函数。相反,近来有更多工作探索通过与人类交互来学习该做什么。迄今为止,这类方法大多将人类建模为(含噪)理性的,尤其给出无偏反馈。我们认为这些模型过于简化,RL研究者需要开发更真实的人类模型以设计和评估其算法。特别地,我们认为人类模型必须是个性化的、情境化的和动态的。本文呼吁来自不同学科的研究来解决关于人类如何向AI提供反馈以及我们如何构建更鲁棒的人在环强化学习系统的关键问题。
引用
@article{arxiv.2206.13316,
title = {Humans are not Boltzmann Distributions: Challenges and Opportunities for Modelling Human Feedback and Interaction in Reinforcement Learning},
author = {David Lindner and Mennatallah El-Assady},
journal= {arXiv preprint arXiv:2206.13316},
year = {2022}
}
备注
Accepted to Communication in Human-AI Interaction Workshop (CHAI) at IJCAI-ECAI-22