对话上下文 Bandit 的高效探索性关键术语选择策略
机器学习
2023-10-03 v2 机器学习
摘要
对话上下文 bandit 通过偶尔查询关键术语的显式反馈来获取用户偏好,以加速学习。然而,现有方法在某些方面限制了其性能。首先,从关键术语级对话和臂级推荐中获得的信息未能适当整合以加速学习。其次,提出探索性关键术语以快速获取用户在不同领域的潜在兴趣,从而加速用户偏好估计的收敛,这一点在现有工作中从未被考虑。为解决这些问题,我们首先提出“ConLinUCB”,一个更好的信息整合的对话 bandit 通用框架,该框架在每个时间步将臂级和关键术语级反馈结合,一步估计用户偏好。基于此框架,我们进一步设计了两种具有探索性关键术语选择策略的 bandit 算法:ConLinUCB-BS 和 ConLinUCB-MCR。我们证明了所提算法更紧的遗憾上界。特别地,ConLinUCB-BS 实现了 的遗憾界,优于之前的结果 。在合成数据和真实数据上的大量实验表明,与经典 ConUCB 算法相比,我们的算法在学习准确率(最高提升 54%)和计算效率(最高提升 72%)方面具有显著优势,显示出对推荐系统的潜在益处。
引用
@article{arxiv.2303.00315,
title = {Efficient Explorative Key-term Selection Strategies for Conversational Contextual Bandits},
author = {Zhiyong Wang and Xutong Liu and Shuai Li and John C. S. Lui},
journal= {arXiv preprint arXiv:2303.00315},
year = {2023}
}