价值漂移:追踪LLM后训练中的价值对齐
计算与语言
2025-10-31 v1 计算机与社会
机器学习
摘要
随着大型语言模型(LLM)在社会中发挥越来越重要的作用,它们越来越可能面临需要不仅依赖一般知识,还需与特定人类价值体系相匹配的问题。因此,研究LLM与人类价值观的对齐已成为至关重要的研究领域。然而,现有工作主要关注对完全训练的模型进行对齐评估,忽略了模型学习表达人类价值观的训练动力学。在本工作中,我们研究了价值对齐在模型后训练过程中的时机和方式。我们的分析扭曲了后训练算法和数据集的影响,测量价值漂移的幅度和时间。在Llama-3和Qwen-3不同规模的模型上实验,使用流行的监督微调(SFT)和偏好优化数据集和算法,我们发现SFT阶段通常建立模型的价值观,后续的偏好优化很少重新对齐这些价值观。此外,利用能够控制价值操纵的合成偏好数据集,我们发现不同的偏好优化算法即使在偏好数据保持不变的情况下也会导致不同的价值对齐结果。我们的发现为如何在后训练期间学习价值观提供了可操作的见解,帮助人们在数据精选、模型和算法选择方面进行偏好优化,以提高模型与人类价值观的对齐程度。
引用
@article{arxiv.2510.26707,
title = {Value Drifts: Tracing Value Alignment During LLM Post-Training},
author = {Mehar Bhatia and Shravan Nayak and Gaurav Kamath and Marius Mosbach and Karolina Stańczak and Vered Shwartz and Siva Reddy},
journal= {arXiv preprint arXiv:2510.26707},
year = {2025}
}