偏好数据有限?通过潜在空间合成学习更好的奖励模型
计算与语言
2025-10-15 v2
摘要
奖励建模对于将大型语言模型 (LLM) 与人类偏好对齐至关重要,但常常受到偏好数据高成本的瓶颈限制。现有的文本数据合成方法计算成本高昂。我们提出了一种新颖的框架 LENS,用于直接在 LLM 的潜在嵌入空间中合成偏好数据。我们的方法采用变分自编码器 (VAE) 来学习响应嵌入的结构化潜在表示。通过在此潜在空间中进行受控扰动并解码回嵌入空间,我们高效地生成了多样化、语义一致的合成偏好对,从而绕过了昂贵的文本生成和标注。我们提供了理论保证,证明我们合成的偏好对近似保留了原始偏好排序,并提高了奖励模型的泛化能力。实验证明,我们的潜在空间合成在标准基准测试上显著优于基于文本的增强,取得了更优的结果,同时生成速度快 18 倍,且使用的模型小 16,000 倍。我们的工作为通过高效数据增强来增强奖励建模提供了一种可扩展且有效的替代方案。代码可在 https://github.com/deeplearning-wisc/lens 公开获取。
引用
@article{arxiv.2509.26074,
title = {Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis},
author = {Leitian Tao and Xuefeng Du and Sharon Li},
journal= {arXiv preprint arXiv:2509.26074},
year = {2025}
}
备注
Accepted by NeurIPS 2025