对抗对齐:确保大型语言模型在敏感领域的价值一致性
计算与语言
2026-01-23 v2
摘要
随着大型语言模型 (LLMs) 的广泛应用,敏感领域的偏见和价值不一致问题逐渐显现,尤其是在种族、社会和政治方面。在本文中,我们提出了一个对抗对齐框架,通过持续预训练、指令微调和对抗训练来增强模型在敏感领域的价值一致性。在对抗训练中,我们使用 Attacker 生成有争议的查询,使用 Actor 生成具有价值一致性的回复,并使用 Critic 进行过滤和确保回复质量。此外,我们针对敏感领域训练了一个价值一致的大型语言模型 (VC-LLM),并构建了一个中英双语评估数据集。实验结果表明,VC-LLM 在中文和英文测试中的表现均优于现有的主流模型,验证了该方法的有效性。警告:本文包含本质上具有冒犯性或有害性的 LLM 示例。
引用
@article{arxiv.2601.13137,
title = {Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains},
author = {Yuan Gao and Zhigang Liu and Xinyu Yao and Bo Chen and Xiaobing Zhao},
journal= {arXiv preprint arXiv:2601.13137},
year = {2026}
}
备注
13 pages, 5 figures