中文

教模型在说服与接受之间取得平衡

计算与语言 2025-02-11 v2 人工智能

摘要

大型语言模型(LLM)容易受到说服,可能在面对对抗性对话者时带来风险。我们首次着手防御模型受说服影响,同时也认为仅防御来自对抗性(即负面)说服是半个方程:模型也应能够接受有益(即积极)说服以改进其答案。我们表明,仅为一个方向优化会导致另一方向性能差。为实现积极与负面说服的平衡,我们引入说服训练(PBT),该方法利用多智能体递归对话树生成数据,并通过偏好优化训练模型,以在合适时接受说服。PBT 允许我们使用来自较小 7-8B 模型的对话数据训练更大的 70B 模型。此外,PBT 在抗 misinformation 和抗挑战性压力方面一致性提升,同时在包含积极与负面说服的整体数据上实现最佳整体性能。关键的是,我们表明 PBT 模型在两个领域( trivia 和commonsense QA)的多智能体辩论中是更好的搭档。我们发现,在没有 PBT 的情况下,较强与较弱模型的组合性能不稳定,模型呈现答案的顺序会决定团队获得较强或较弱模型的性能。PBT 带来更好的、更稳定的结果,减少顺序依赖,较强模型始终能拉拽较弱模型。

关键词

引用

@article{arxiv.2410.14596,
  title  = {Teaching Models to Balance Resisting and Accepting Persuasion},
  author = {Elias Stengel-Eskin and Peter Hase and Mohit Bansal},
  journal= {arXiv preprint arXiv:2410.14596},
  year   = {2025}
}

备注

NAACL Camera-Ready. Code: https://github.com/esteng/persuasion_balanced_training