面向对抗论证的大语言模型忠诚完整性对齐
计算与语言
2025-01-03 v1
摘要
大型语言模型(LLM)在复杂推理任务中展现了惊人的能力。然而,这些模型在对话中容易被不忠诚的论证所误导,即使其原始陈述是正确的。在此基础上,我们研究维护 LLM 在面对对抗论证时的忠诚完整性的问题,这涉及确保 LLM 在面对对抗论证时遵循其忠诚陈述,并在面对忠诚论证时纠正其错误陈述。在本工作中,我们提出了一种新型框架,称为 Alignment for Faithful Integrity with Confidence Estimation(AFICE),旨在对 LLM 响应进行忠诚完整性对齐。具体而言,AFICE 首先设计了双向置信度估计(BCE)方法,用于估计给定特定上下文由 LLM 生成的每个响应的不确定性,这同时估计模型基于解码期间内部状态对问题的置信度以及对答案的置信度。有了 BCE,我们构建了一个由上下文、原始陈述和论证组成的对话式偏好数据集,用于使用直接偏好优化(DPO)对 LLM 进行忠诚完整性对齐。广泛的实验结果表明,在面对各种基准测试中,AFICE 对 LLM 在遇到对抗论证时保持忠诚响应的能力显著提升,确保了其在复杂交互环境中的实际实用性和可信度。代码和数据将通过 https://github.com/zhaoy777/AFICE.git 发布。
引用
@article{arxiv.2501.01336,
title = {Aligning Large Language Models for Faithful Integrity Against Opposing Argument},
author = {Yong Zhao and Yang Deng and See-Kiong Ng and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2501.01336},
year = {2025}
}
备注
17 pages, 5 figures