一种用于依从感知推荐的 Q-learning 方法
机器学习
2024-07-18 v1 系统与控制
系统与控制
摘要
在许多涉及高风险与安全影响的现实场景中,人类决策者(HDM)可能接收来自人工智能的推荐,同时承担最终决策责任。在本文中,我们提出一种“依从感知 Q-learning”算法来解决该问题。该算法学习刻画 HDM 遵循推荐动作频率的“依从水平”,并实时推导最佳推荐策略。我们证明了所提 Q-learning 算法收敛至最优值,并在多种场景下评估了其性能。
引用
@article{arxiv.2309.06519,
title = {A Q-learning Approach for Adherence-Aware Recommendations},
author = {Ioannis Faros and Aditya Dave and Andreas A. Malikopoulos},
journal= {arXiv preprint arXiv:2309.06519},
year = {2024}
}