中文

通过潜在特征驾驭来缓解误差感染

人工智能 2026-05-12 v2 计算与语言

摘要

语言模型(LM)日益用于高风险的多主体场景,其中遵循指令和维持价值对齐至关重要。大多数对齐研究聚焦于单个 LM 与单个用户之间的交互,未能解决多个 LM 在多轮交互中误差行为传播的风险。我们发现证据表明,这一现象——我们称之为误差感染——在多个 LM 参与多轮对话社会困境游戏时确实存在。具体而言,我们发现 LM 在游戏后变得更具反社会行为,且当其他玩家被引导行为不当时,这一效果被放大。我们探讨了不同的驾驭技术以缓解此类误差感染,发现强化 LM 系统提示本身不足,甚至可能有害。相反,我们提出一种使用潜在特征(implicit traits)的驾驶技术:该技术间歇性地注入包含强化 LM 初始特征的系统提示的语句,比系统提示重复在保持模型遵循其初始积极行为方面更有效。重要的是,这种方法无需访问模型参数或内部模型状态,使其适用于日益常见的使用黑盒模型设计复杂多主体工作流程的场景。

关键词

引用

@article{arxiv.2605.02751,
  title  = {Mitigating Misalignment Contagion by Steering with Implicit Traits},
  author = {Maria Chang and Ronny Luss and Miao Liu and Keerthiram Murugesan and Karthikeyan Ramamurthy and Djallel Bouneffouf},
  journal= {arXiv preprint arXiv:2605.02751},
  year   = {2026}
}