面向大语言模型的证据驱动分布对齐
机器学习
2026-03-17 v1 人工智能
摘要
分布式对齐使大语言模型(LLM)能够预测目标人群在答案选项上的响应分布,而不是将不同意见坍缩为单一共识答案。然而,现有的LLM基于分布预测常常不稳定,在文化和领域迁移下性能会下降。基于token得分的估计会因选项措辞或格式的微小变化而变化,基于响应抽样的估计成本高昂且对提示和解码设置敏感,而直接生成的分布常常不准确。我们提出Evi-DA(证据驱动对齐),一种改进LLM基于分布估计保真度和鲁棒性的对齐技术,特别是在领域和文化迁移情境下。给定目标国家和一个多选题,Evi-DA检索相关世界价值观调查项目及其答案分布,预测每个选项的粗略Welzel价值签名,并以结构化格式推断国家条件化的答案分布。我们采用两阶段管道进行训练,其中强化学习优化源自调查的奖励,以鼓励准确的中间价值预测、忠实的最终分布、规范的结构化输出以及减少文化偏见。在多个领域内和外基准以及多种开源模型 Backbone 上,Evi-DA相对于强大基线将预测分布与黄金分布之间的 Jensen-Shannon 散度降低了平均高达44%。
引用
@article{arxiv.2603.13305,
title = {Evidence-based Distributional Alignment for Large Language Models},
author = {Viet-Thanh Pham and Lizhen Qu and Zhuang Li and Gholamreza Haffari},
journal= {arXiv preprint arXiv:2603.13305},
year = {2026}
}