中文

论状态空间聚类在个性化任务中不合理的效率

机器学习 2021-12-28 v1 人工智能 数值分析 数值分析

摘要

在本工作中,我们考虑一种强化学习(RL)技术,用于求解具有复杂奖励信号的个性化任务。具体而言,我们的方法基于状态空间聚类,使用了简化的 kk-means 算法以及常规的网络架构与优化算法选择。数值例子展示了不同 RL 过程的效率,并用于说明该技术加速了智能体的学习能力且未限制智能体的性能。

关键词

引用

@article{arxiv.2112.13141,
  title  = {On the Unreasonable Efficiency of State Space Clustering in Personalization Tasks},
  author = {Anton Dereventsov and Ranga Raju Vatsavai and Clayton Webster},
  journal= {arXiv preprint arXiv:2112.13141},
  year   = {2021}
}