中文

情境多臂老虎机中的神经风险敏感保守

机器学习 2025-01-16 v1

摘要

情境多臂老虎机问题是一种强化学习任务,为解决推荐系统中的实际需求满足、个性化以及冷启动问题等挑战提供了有效框架。然而,情境多臂老虎机算法面临挑战,因为它们需要顺序处理大型状态-动作空间。这些挑战包括学习和平衡探索与开发的高成本,以及性能在不同应用领域中的大幅变动。为了应对这些挑战,Tsuboya等人提出了区域线性风险敏感保守(RegLinRS)算法。RegLinRS根据代理已实现目标的程度,在探索和开发之间切换。然而,RegLinRS中的奖励期望是基于特征线性近似的,这限制了其在特征与奖励期望关系非线性时适用性。为了处理更复杂的环境,我们提出了神经风险敏感保守(NeuralRS),将神经网络纳入RegLinRS中,并展示了其实用性。

关键词

引用

@article{arxiv.2501.08612,
  title  = {Neural Risk-sensitive Satisficing in Contextual Bandits},
  author = {Shogo Ito and Tatsuji Takahashi and Yu Kono},
  journal= {arXiv preprint arXiv:2501.08612},
  year   = {2025}
}

备注

Accepted by AROB-ISBC 2025