中文

基于日志棋盘数据的提示优化

高能物理 - 理论 2025-04-04 v1

摘要

我们研究如何使用用户反馈(如点击)来优化用于生成个性化句子的大型语言模型(LLM)管道中的提示。粗略的方法会估计提示空间中的政策梯度,导致动作空间大导致的方差问题,或由于奖励预测不准确导致的偏差问题。为规避这些挑战,我们提出了一种基于核的方法的离策略梯度方法,通过利用生成句子之间的相似性来估计政策梯度,显著降低方差的同时抑制偏差。我们在全新的基准套件上进行的实证结果表明,所提出的方法在生成电影推荐的个性化描述方面有效,特别是在候选提示数量较大时效果更为突出。

关键词

引用

@article{arxiv.2504.02645,
  title  = {Black Holes, Moduli Stabilisation and the Swampland},
  author = {Matilda Delgado and Sébastien Reymond and Thomas Van Riet},
  journal= {arXiv preprint arXiv:2504.02645},
  year   = {2025}
}

备注

18 pages, 1 figure, 3 appendices