FedConPE:基于相位消除机制的高效联邦对话式 bandit 算法
机器学习
2024-08-13 v2 人工智能
机器学习
摘要
对话式推荐系统已成为高效获取用户偏好的强大解决方案。这些系统会交互式地呈现与“关键术语”相关的查询,并利用用户反馈来更高效地估计用户偏好。然而,大多数现有算法采用集中式方法。本文引入 FedConPE,一种基于相位消除机制的联邦对话式 bandit 算法,其中 M 个代理通过中央服务器协作解决全局情境线性 bandit 问题,同时确保安全的数据管理。为有效协调所有客户端并聚合其收集的数据,FedConPE 使用自适应方法构建关键术语,以最小化特征空间中所有维度的不确定性。此外,与现有联邦线性 bandit 算法相比,FedConPE 在计算和通信效率方面具有更好的性能,同时提供了更强的隐私保护。我们的理论分析表明,FedConPE 在累积遗憾方面具有次近最优性。我们还给出了通信成本和对话频率的上界。综合评估表明,FedConPE 在使用更少对话次数的情况下,优于现有的对话式 bandit 算法。
关键词
引用
@article{arxiv.2405.02881,
title = {FedConPE: Efficient Federated Conversational Bandits with Heterogeneous Clients},
author = {Zhuohua Li and Maoli Liu and John C. S. Lui},
journal= {arXiv preprint arXiv:2405.02881},
year = {2024}
}
备注
Accepted to the 33rd International Joint Conference on Artificial Intelligence (IJCAI), 2024