中文

多尺度上下文型臂 Bandit 用于长期目标

机器学习 2025-05-29 v2

摘要

AI 系统(如推荐系统、聊天机器人)收集的用户交互反馈是训练数据的关键来源。虽然短期反馈(如点击、互动)广泛用于训练,但优化短期反馈并不一定实现所需的长期目标。直接优化长期目标面临挑战,我们认识到短期干预(如排序)与长期反馈(如用户留存)时间尺度之间的断裂作为关键障碍之一。为克服这一断裂,我们引入了多尺度策略学习框架,以上下文方式在多个相互依赖的时间尺度上进行决策和优化。遵循 PAC-Bayes 动机,我们展示了较低时间尺度(数据更丰富)可提供数据依赖的分层先验,以加快更高尺度(数据更稀缺)上的学习速度。结果,所有层级的策略都有效地优化了长期目标。我们以多尺度离-policy Bandit 学习(MSBL)实现了该框架,并在三个与推荐和对话系统相关的任务上展示了其有效性。

关键词

引用

@article{arxiv.2503.17674,
  title  = {MultiScale Contextual Bandits for Long Term Objectives},
  author = {Richa Rastogi and Yuta Saito and Thorsten Joachims},
  journal= {arXiv preprint arXiv:2503.17674},
  year   = {2025}
}