QA-LIGN:通过结构化 QA 分解实现 LLM 对齐
计算与语言
2025-12-05 v5
摘要
大语言模型 (LLMs) 的对齐通常依赖单一的标量奖励,这会遮蔽哪些目标驱动了训练信号。我们提出 QA-LIGN,通过结构化自然语言程序将单一奖励分解为可解释的、针对特定原则的评估。模型通过草稿、批判和修订的管道进行学习,符号评估提供针对 rubrics 的透明反馈,用于初始和修订后的响应,在 GRPO 训练期间。应用于未过滤的 Llama-3.1-8B-Instruct,QA-LIGN 将攻击成功率降低最高可达 68.7%,同时保持 0.67% 的错误拒绝率,实现了在安全性和有用性之间达到帕累托最优性能,优于 DPO 和 GRPO,尤其是在给定等效训练的状态奖励模型下表现更佳。这些结果表明,使奖励信号可解释和模块化有助于提高对齐效果,暗示透明度可以增强 LLM 的安全性。
引用
@article{arxiv.2506.08123,
title = {QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA},
author = {Jacob Dineen and Aswin RRV and Qin Liu and Zhikun Xu and Xiao Ye and Ming Shen and Zhaonan Li and Shijie Lu and Chitta Baral and Muhao Chen and Ben Zhou},
journal= {arXiv preprint arXiv:2506.08123},
year = {2025}
}
备注
Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China