中文

大语言模型中的说服动力学:关于 DuET-PD 在知识与安全方面的鲁棒性与适应性研究

计算与语言 2025-09-10 v3 计算机与社会

摘要

大型语言模型(LLMs)在说服性对话中可能难以在对误导信息的盲目信任与对有效纠正的抵抗之间取得平衡,这是可靠部署的关键挑战。我们引入 DuET-PD(Dual Evaluation for Trust in Persuasive Dialogues),一个用于评估说服类型(纠正性/误导性)和领域(通过 MMLU-Pro 获取知识,通过 SALAD-Bench 测试安全性)的双维度说服对话中立场变化动力学的框架。我们发现,即使是像 GPT-4o 这样的前沿模型,在持续的误导性说服情境下也仅达到了 27.32% 的 MMLU-Pro 正确率。此外,结果揭示了较新开源模型中增加迎合心态的令人担忧的趋势。为此,我们引入了整合性 DPO(Holistic DPO),一种平衡正负说服示例的训练方法。与提示词工程或仅进行抵抗性训练不同,Holistic DPO 增强了对误导信息的鲁棒性和对纠正意见的接受度,将 Llama-3.1-8B-Instruct 在误导性说服情境下的知识准确率从 4.21% 提升至 76.54%。这些贡献为开发用于多轮对话的更可靠且更具适应性的大语言模型提供了一条路径。代码已公开于 https://github.com/Social-AI-Studio/DuET-PD。

关键词

引用

@article{arxiv.2508.17450,
  title  = {Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PD},
  author = {Bryan Chen Zhengyu Tan and Daniel Wai Kit Chin and Zhengyuan Liu and Nancy F. Chen and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2508.17450},
  year   = {2025}
}

备注

To appear at EMNLP 2025