中文

GTAlign: 基于博弈论的 LLM 助手对齐以实现社会福利最大化

人工智能 2025-11-04 v3 计算机科学与博弈论 人机交互 机器学习 多智能体系统

摘要

大型语言模型(LLMs)在推理方面取得了显著进展,但有时会生成对用户而言次优的响应,例如在写作、信息检索或提供实用指导等任务中。传统的对齐实践通常假设最大化模型奖励也能最大化用户福利,但这一假设在实践中经常失效:模型可能在用户偏好简洁回答时过度澄清或生成过于冗长的推理。这种行为类似于囚徒困境,其中个体理性选择会导致社会次优结果。根本挑战在于缺乏一种能够使 LLM 和用户双方互惠的原则性决策机制。我们提出博弈论对齐(GTAlign),一种将博弈论决策融入推理和训练的对齐框架。在推理阶段,模型将用户-LLM 交互显式视为策略博弈:它在推理链中构建收益矩阵以估计自身和用户的福利,然后选择互利的行动。在训练阶段,我们引入社会福利奖励以强化合作响应,使模型行为与社会高效结果保持一致。此外,我们引入一种推理技术,利用博弈论推理在 LLM 服务定价策略变化时动态调整 LLM 的响应。大量实验表明,GTAlign 在推理效率、回答质量和社会福利方面相比基线方法有显著提升。代码可在 https://github.com/ulab-uiuc/GTAlign 获取。

关键词

引用

@article{arxiv.2510.08872,
  title  = {GTAlign: Game-Theoretic Alignment of LLM Assistants for Social Welfare},
  author = {Siqi Zhu and David Zhang and Pedro Cisneros-Velarde and Jiaxuan You},
  journal= {arXiv preprint arXiv:2510.08872},
  year   = {2025}
}

备注

31 pages, 6 figures