基于老虎机反馈的分层对话式偏好 elicitation
信息检索
2022-09-14 v1 机器学习
摘要
对话式推荐的最新进展提供了一种通过对话交互高效获取用户偏好的有前景途径。为此,推荐系统与用户对话,询问其对不同条目或条目类别的偏好。现有多数面向冷启动用户的对话式推荐系统利用多臂老虎机框架在线学习用户偏好。然而,它们依赖预定义的对话频率来询问条目类别而非单个条目,这可能引发过多的对话交互而损害用户体验。为支持对关键词更灵活的询问,我们构建了一个新的对话式老虎机问题,允许推荐系统在每轮选择关键词或条目进行推荐,并显式建模这些动作的奖励。这促使我们处理关键词询问与条目推荐之间新的探索-利用(EE)权衡,要求我们准确建模关键词与条目奖励间的关系。我们开展一项调查并分析真实世界数据集,发现与先前工作假设不同,关键词奖励主要受代表性条目奖励影响。我们提出两种老虎机算法 Hier-UCB 和 Hier-LinUCB,利用该观测关系及关键词与条目间的层次结构,高效学习应推荐哪些条目。我们从理论上证明,所提算法可将遗憾界对条目总数的依赖从先前工作降低。我们在合成与真实世界数据上验证了所提算法及遗憾界。
引用
@article{arxiv.2209.06129,
title = {Hierarchical Conversational Preference Elicitation with Bandit Feedback},
author = {Jinhang Zuo and Songwen Hu and Tong Yu and Shuai Li and Handong Zhao and Carlee Joe-Wong},
journal= {arXiv preprint arXiv:2209.06129},
year = {2022}
}