博弈论大语言模型对齐的基本局限:Smith一致性与偏好匹配
计算机科学与博弈论
2025-05-28 v1 机器学习
摘要
基于人类反馈的纳什学习是一种博弈论框架,通过将学习建模为一个两人零和博弈,使大语言模型(LLMs)与人类偏好对齐。然而,在博弈中使用原始偏好作为收益极大地限制了博弈论大语言模型对齐框架的潜力。在本文中,我们系统地研究了基于成对人类偏好选择何种收益函数能够产生理想的对齐属性。我们为孔多塞一致性、通过混合策略实现的多样性以及 Smith 一致性建立了充分必要条件。这些结果为博弈论大语言模型对齐的鲁棒性提供了理论基础。此外,我们证明了偏好匹配的不可能性——即,即使在 Bradley-Terry-Luce 模型等标准假设下,也没有平滑且可学习的成对偏好映射能够保证存在一个与目标策略匹配的唯一纳什均衡。这一结果凸显了博弈论大语言模型对齐的根本局限性。
引用
@article{arxiv.2505.20627,
title = {Fundamental Limits of Game-Theoretic LLM Alignment: Smith Consistency and Preference Matching},
author = {Zhekun Shi and Kaizhao Liu and Qi Long and Weijie J. Su and Jiancong Xiao},
journal= {arXiv preprint arXiv:2505.20627},
year = {2025}
}