中文

利用对话的力量:对话式上下文 Bandit 中的最优关键词选择

机器学习 2025-05-28 v1 人工智能

摘要

对话式推荐系统主动向用户查询相关的“关键词”,并利用反馈来引导用户的偏好以进行个性化推荐。对话式上下文 Bandit 是该领域的一种主流方法,旨在通过平衡利用与探索来优化偏好学习。然而,一些局限性阻碍了它们在真实场景中的有效性。首先,现有算法采用的关键词选择策略探索不足,往往无法彻底探测用户的偏好,导致偏好估计次优。其次,当前算法通常依赖确定性规则来发起对话,当偏好已被充分理解时会导致不必要的交互,而当偏好不确定时则会错失机会。为了解决这些局限性,我们提出了三种新算法:CLiSK、CLiME 和 CLiSK-ME。CLiSK 引入平滑的关键词上下文以增强偏好学习中的探索,CLiME 基于偏好不确定性自适应地发起对话,而 CLiSK-ME 则集成了这两种技术。我们在理论上证明,这三种算法相对于时间跨度 TT 实现了 O(dTlogT)O(\sqrt{dT\log{T}}) 的更紧的遗憾上界,改进了现有方法。此外,我们为对话式 Bandit 提供了匹配的下界 Ω(dT)\Omega(\sqrt{dT}),证明我们的算法是近似极小化极大的。在合成和真实数据集上的广泛评估表明,我们的方法在累积遗憾上实现了至少 14.6% 的改进。

关键词

引用

@article{arxiv.2505.21393,
  title  = {Leveraging the Power of Conversations: Optimal Key Term Selection in Conversational Contextual Bandits},
  author = {Maoli Liu and Zhuohua Li and Xiangxiang Dai and John C. S. Lui},
  journal= {arXiv preprint arXiv:2505.21393},
  year   = {2025}
}

备注

Accepted at the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2025