中文

利用 LLM 生成的先验知识启动多臂偏置问题

机器学习 2024-10-30 v2 人工智能 计算与语言

摘要

我们提出了大量证据,表明将大型语言模型 (LLM) 与情境多臂偏置框架集成具有显著优势。情境偏置问题广泛用于推荐系统,根据用户特定情境生成个性化建议。我们展示了 LLM 预先在丰富人类知识和偏好的语料库上训练的模型,足以模拟人类行为,以减少在线学习 regret。我们提出了一种针对情境偏置问题的初始化算法,通过提示 LLM 生成约 approximate 人类偏好的数据集用于偏置问题。这显著减少了在线学习 regret 和数据收集成本。我们的方案通过两种不同实验设置的实证验证:一种利用 LLM 作为评判 oracle,另一种利用来自 conjoint 调查实验的数据的真实世界实验。

关键词

引用

@article{arxiv.2406.19317,
  title  = {Jump Starting Bandits with LLM-Generated Prior Knowledge},
  author = {Parand A. Alamdari and Yanshuai Cao and Kevin H. Wilson},
  journal= {arXiv preprint arXiv:2406.19317},
  year   = {2024}
}