中文

通过 KL 优化微调控制多轮 LLM 生成中的分布偏差

计算与语言 2026-04-08 v1

摘要

尽管现实世界本质上具有随机性,大语言模型(LLMs)主要通过单轮推理对照固定真实值进行评估。在本工作中,我们将视角转向分布对齐:评估 LLMs 在被反复提示时,能否生成符合期望目标分布的输出,例如反映现实世界统计或均匀分布。我们使用职业语境中的性别、种族和情感属性来构建分布对齐。实证分析表明,现有的 LLMs 和标准对齐技术(包括提示工程和直接偏好优化)无法可靠地控制输出分布。为弥补这一差距,我们提出了一种新颖的微调框架,将 Steering Token Calibration 与语义对齐相结合。我们引入了一种混合目标函数,结合 KL 散度来锚定潜空间 Steering Token 的概率质量,以及 Kahneman-Tversky Optimization 将这些 Token 绑定到语义一致的响应上。在六个多样化数据集上的实验表明,我们的方法显著优于基线,在属性生成任务中实现了精确的分布控制。

关键词

引用

@article{arxiv.2604.05756,
  title  = {Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning},
  author = {Yanbei Jiang and Amr Keleg and Ryandito Diandaru and Jey Han Lau and Lea Frermann and Biaoyan Fang and Fajri Koto},
  journal= {arXiv preprint arXiv:2604.05756},
  year   = {2026}
}

备注

Accepted at ACL Main Conference