ECLIPTICA -- 基于 CITA 的可切换 LLM 对齐框架
机器学习
2026-01-13 v1 人工智能
摘要
大型语言模型(LLM)的对齐仍主要是静态的:在训练后,策略被冻结。DPO、GRPO 方法通常在权重中铸刻一种行为,除了提示技巧或昂贵的重新对齐之外,几乎没有运行时控制。我们引入 ECLIPTICA,将对齐视为受指令驱动且可在运行时控制的过程:自然语言对齐指令充当明确的行为契约(立场、拒绝边界、 verbosity),在不断变化的安全要求、用户角色和治理约束下调节行为。我们引入 CITA(Contrastive Instruction-Tuned Alignment),将 SFT 与对比偏好优化结合在明确的几何锚定到参考模型的基础上。这是产生了一个稳定的罗米尼亚图谱,使指令更新保持在共享的邻域内,因此各个方案彼此相邻且可遍历,以实现可靠的切换。为隔离策略切换与普通指令遵循,我们发布 ECLIPTICA 框架:3000 个受控案例(300 个提示 x 10 种指令类型),其中用户请求固定,仅更改对齐指令。在 Llama-3.1-8B 上测试 5 个套件(ECLIPTICA、TruthfulQA、Conditional Safety、Length Control、LITMUS),CITA 达到 86.7% 的指令对齐效率,超过 DPO(56.1%)、GRPO(36.1%)和 PPO(20.4%)。
引用
@article{arxiv.2601.06157,
title = {ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment},
author = {Kapil Wanaskar and Gaytri Jena and Vinija Jain and Aman Chadha and Amitava Das},
journal= {arXiv preprint arXiv:2601.06157},
year = {2026}
}