中文

VISA:通过盾牌适应注入价值实现个性化大语言模型对齐

人工智能 2026-03-06 v1

摘要

与细粒度人类价值观对齐的大语言模型(LLM)仍是关键挑战,因为现有方法如基于人类反馈的强化学习(RLHF)通常仅处理粗粒度属性。在实际应用中,对 LLM 在特定任务数据集上进行微调以优化价值对齐不可避免地造成alignment tax:模型的预校准价值体系因潜在偏见被训练数据吸收而发生显著偏移,同时微调过程也会导致严重的幻觉和生成响应中的语义信息丢失。为此,我们提出了 VISA(Value Injection via Shielded Adaptation,盾牌式价值注入),一个旨在导航此权衡的闭环框架。VISA 的架构包括高精度价值探测器、语义到价值的转换器,以及核心价值重写器。价值重写器通过组合奖励函数进行 Group Relative Policy Optimization(GRPO)训练,同时优化细粒度价值精度和语义完整性的保存。通过学习在这些竞争目标之间取得最佳平衡的策略,VISA 有效缓解了alignment tax,同时忠于原始知识。我们的实验表明,该方法实现了对模型价值表达的精确控制,同时保持事实一致性和通用能力,显著优于标准微调方法和基于提示的基线,包括 GPT-4o。

关键词

引用

@article{arxiv.2603.04822,
  title  = {VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment},
  author = {Jiawei Chen and Tianzhuo Yang and Guoxi Zhang and Jiaming Ji and Yaodong Yang and Juntao Dai},
  journal= {arXiv preprint arXiv:2603.04822},
  year   = {2026}
}