最大化提示与响应之间互信息以提升LLM性能:无需额外数据
机器学习
2026-05-29 v3 人工智能
计算与语言
摘要
后训练已成功在各种领域提高大型语言模型(LLM)的性能,但这些收益严重依赖人工标注数据或外部验证器。现有数据已被充分利用,收集新数据成本高昂。此外,真正的智力远超可验证任务。因此,我们需要一种更少依赖外部信号、更广泛适用于可验证和不可验证领域的自我改进框架。我们提出一种**相互信息偏好优化(MIPO)**,一种对比数据增强方法,通过在正确提示下生成正面响应,并在随机无关提示下生成负面响应来构建偏好对。我们表明,使用直接偏好优化从这些配对数据中学习可最大化*以基础LLM为条件*的提示与模型响应之间的点互信息。在1-7B参数的Llama和Qwen指令模型实验中,MIPO在个人化任务上相对于提示基线实现了3-16%的提升(且针对Qwen2.5-1B-Instruct实现了51%的提升)。意外的是,MIPO在可验证领域也有用处,如数学和多选题回答,实现了1-20%的提升*无需任何额外数据或外部监督*。这些结果表明,使用从对比数据对中派生的内在信号进行自我改进具有前景。
引用
@article{arxiv.2603.19294,
title = {Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data},
author = {Hyunji Nam and Haoran Li and Natasha Jaques},
journal= {arXiv preprint arXiv:2603.19294},
year = {2026}
}
备注
International Conference on Machine Learning 2026