中文

驶向冻结LLM: 通过在线提示路由实现自适应社会对齐

机器学习 2026-03-18 v1 人工智能

摘要

大型语言模型(LLM)通常受后训练对齐(如RLHF或DPO)的约束,这导致部署和推理期间策略基本静态。然而,现实中的安全是全生命周期问题:静态防御会针对不断演化的越狱行为退化,固定权重无法适应多元且随时间变化的安全规范。这就动机了一种无需高成本重新训练即可进行推理时治理以引导行为的框架。为此,我们引入Consensus Clustering LinUCB Bandit(CCLUB),这是一个用于通过系统提示路由实现自适应社会对齐的统一框架。CCLUB采用保守的共识聚类机制:它仅在效用和安全相似图的交集中汇聚数据,有效防止跨语义相近但风险差异的上下文进行不安全的泛化。我们的理论分析给出亚线性忧 regret保证,表明CCLUB接近最优性能。广泛的实验验证表明,CCLUB在强大的基线之上表现更好,实现了累积奖励提升10.98%,平均次优值间隙降低14.42%。

关键词

引用

@article{arxiv.2603.15647,
  title  = {Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing},
  author = {Zeyu Zhang and Xiangxiang Dai and Ziyi Han and Xutong Liu and John C. S. Lui},
  journal= {arXiv preprint arXiv:2603.15647},
  year   = {2026}
}