论状态空间聚类在个性化任务中不合理的效率
机器学习
2021-12-28 v1 人工智能
数值分析
数值分析
摘要
在本工作中,我们考虑一种强化学习(RL)技术,用于求解具有复杂奖励信号的个性化任务。具体而言,我们的方法基于状态空间聚类,使用了简化的 -means 算法以及常规的网络架构与优化算法选择。数值例子展示了不同 RL 过程的效率,并用于说明该技术加速了智能体的学习能力且未限制智能体的性能。
引用
@article{arxiv.2112.13141,
title = {On the Unreasonable Efficiency of State Space Clustering in Personalization Tasks},
author = {Anton Dereventsov and Ranga Raju Vatsavai and Clayton Webster},
journal= {arXiv preprint arXiv:2112.13141},
year = {2021}
}