辅助多臂_bandit 设定中风险厌恶的有偏人类策略
机器人学
2021-04-13 v1
摘要
辅助多臂_bandit 问题可用于建模人类与自主系统(如家用服务机器人)之间的团队情境。为考虑累积前景理论中所描述的风险厌恶等人类偏差,该设定扩展为使用可观测奖励。当机器人利用关于风险厌恶人类模型的知识时,它们消除了偏差并做出更理性的选择。我们提出了一种提升此类人机团队效用值的算法。简要评估表明可处理任意奖励函数。
引用
@article{arxiv.2104.05334,
title = {Risk-Averse Biased Human Policies in Assistive Multi-Armed Bandit Settings},
author = {Michael Koller and Timothy Patten and Markus Vincze},
journal= {arXiv preprint arXiv:2104.05334},
year = {2021}
}
备注
in TRAITS Workshop Proceedings (arXiv:2103.12679) held in conjunction with Companion of the 2021 ACM/IEEE International Conference on Human-Robot Interaction, March 2021, Pages 709-711