面向动态个体偏好的社会学习策略:解决冲突人类价值观的配对微调
计算与语言
2026-04-15 v1
摘要
近期大语言模型(LLM)的进展显著提升了模型与一般人类偏好的对齐,但适应个体偏好仍面临主要挑战——这些偏好不仅多样化,而且是动态的。本文引入一种新框架,偏好配对微调(PFT),旨在将模型与相互冲突且不断演变的个体偏好对齐。我们提出了新数据集价值冲突困境(VCD),包含涉及冲突人类偏好的情景,便于评估我们的方法。我们的实验表明,PFT 在多选分类任务中超越单一偏好训练方法,最高可达96.6%准确率,最高的开放式生成得分达8.69。PFT 在 DPO、SFT 和一些传统训练方法方面表现显著,尤其是在处理冲突偏好方面。此外,在有限的用户历史数据下,模型可以快速推断偏好向量,相较于单一偏好模型实现了44.76%的用户特定偏好对齐提升。
引用
@article{arxiv.2604.12479,
title = {Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning},
author = {Shanyong Wang and Shuhang Lin and Yining Zhao and Xi Zhu and Yongfeng Zhang},
journal= {arXiv preprint arXiv:2604.12479},
year = {2026}
}
备注
20 pages, 13 figures