优化说服策略可提升 LLM 泛化能力:来自质量-多样性演化的辩论策略证据
人工智能
2025-10-21 v2
摘要
优化输出真实答案的大语言模型(LLMs)常会过拟合,产生不稳健的推理,难以泛化. 虽然已证明基于说服的优化在辩论情境中具有潜力,但尚未系统性地与主流基于事实的方法进行比较. 我们引入 DebateQD,一种最小化的质量-多样性(Quality-Diversity, QD)进化算法,通过锦标赛式竞技演化不同类别(理性、权威、情感诉求等)的多样化辩论策略,其中两位 LLM 对辩论,第三位裁判判断. 与之前的方法不同,我们的做法通过基于提示的策略维持对手的多样性,而无需多个 LLM 组成的种群,这使得实验更易于实现,同时保留了种群优化的关键优势. 与先前工作不同,我们明确隔离了优化目标的作用,通过固定辩论协议仅交换适应函数:说服奖励说服裁判的策略,不论其真实性;而事实奖励协作正确. 在 7B、32B、72B 三个模型规模以及 QuALITY 数据集的多个数据集大小上,说服优化的策略在训练-测试泛化间隙上实现了最高 13.94% 的减小,同时匹配或超越事实优化的测试性能. 这些结果首次在受控条件下证明,竞争性说服压力而非协作性寻求真理,可培育更可迁移的推理技能,为改善 LLM 泛化能力提供了有前景的路径.
引用
@article{arxiv.2510.05909,
title = {Optimizing for Persuasion Improves LLM Generalization: Evidence from Quality-Diversity Evolution of Debate Strategies},
author = {Aksel Joonas Reedi and Corentin Léger and Julien Pourcel and Loris Gaven and Perrine Charriau and Guillaume Pourcel},
journal= {arXiv preprint arXiv:2510.05909},
year = {2025}
}
备注
Open-source code available at https://github.com/flowersteam/llm_persuasion