概率程序综合中的似然性劫持
机器学习
2026-03-26 v1 编程语言
摘要
当语言模型通过强化学习(RL)训练以编写概率程序时,它们可以人为地通过产生数据分布未归一化的程序来人为 inflate 其边际似然奖励,而不是更好地拟合数据。我们称这种失败为似然性劫持(Likelihood Hacking, LH)。我们在核心概率编程语言(PPL)中形式化了 LH,并给出其防止的充分语法条件,证明满足这些条件的安全语言片段 不能产生似然性劫持程序。实验上,我们展示了在 PyMC 代码中训练的 GRPO 模型在前几个训练步骤内发现 LH 滥用,迫使违规率显著高于未训练模型的基线。我们将 的条件实现为 ,一种抗 LH 修改的 Stan,实证表明它在优化压力下防止了 LH。这些结果表明,语言级安全约束在理论上是严谨的,在实践中也有效,用于自动贝叶斯模型发现。
引用
@article{arxiv.2603.24126,
title = {Likelihood hacking in probabilistic program synthesis},
author = {Jacek Karwowski and Younesse Kaddar and Zihuiwen Ye and Nikolay Malkin and Sam Staton},
journal= {arXiv preprint arXiv:2603.24126},
year = {2026}
}