中文

概率程序综合中的似然性劫持

机器学习 2026-03-26 v1 编程语言

摘要

当语言模型通过强化学习(RL)训练以编写概率程序时,它们可以人为地通过产生数据分布未归一化的程序来人为 inflate 其边际似然奖励,而不是更好地拟合数据。我们称这种失败为似然性劫持(Likelihood Hacking, LH)。我们在核心概率编程语言(PPL)中形式化了 LH,并给出其防止的充分语法条件,证明满足这些条件的安全语言片段 Lsafe\mathcal{L}_{\text{safe}} 不能产生似然性劫持程序。实验上,我们展示了在 PyMC 代码中训练的 GRPO 模型在前几个训练步骤内发现 LH 滥用,迫使违规率显著高于未训练模型的基线。我们将 Lsafe\mathcal{L}_{\text{safe}} 的条件实现为 SafeStan\texttt{SafeStan},一种抗 LH 修改的 Stan,实证表明它在优化压力下防止了 LH。这些结果表明,语言级安全约束在理论上是严谨的,在实践中也有效,用于自动贝叶斯模型发现。

关键词

引用

@article{arxiv.2603.24126,
  title  = {Likelihood hacking in probabilistic program synthesis},
  author = {Jacek Karwowski and Younesse Kaddar and Zihuiwen Ye and Nikolay Malkin and Sam Staton},
  journal= {arXiv preprint arXiv:2603.24126},
  year   = {2026}
}