中文

谁在指挥?解构指令遵循中的角色冲突

计算与语言 2025-12-19 v2 机器学习

摘要

大语言模型应遵循分层指令,即系统提示覆盖用户输入,但近期研究表明它们经常忽略此规则,却强烈遵从权威或共识等社会线索。我们通过大规模数据集上的机制解释扩展了这些行为发现。线性探测显示冲突决策信号被早期编码,系统-用户冲突和社会冲突形成不同的子空间。直接逻辑归因揭示出系统-用户案例中更强的内部冲突检测,但仅对社会线索有一致的解决。干预实验表明,尽管使用了社会线索,这些向量却以角色无关的方式惊人地放大了指令遵循。这些结果共同解释了脆弱的系统服从性,并强调了需要轻量级的层次敏感对齐方法。

关键词

引用

@article{arxiv.2510.01228,
  title  = {Who is In Charge? Dissecting Role Conflicts in Instruction Following},
  author = {Siqi Zeng},
  journal= {arXiv preprint arXiv:2510.01228},
  year   = {2025}
}

备注

12 pages, 5 figures, Mech Interp Workshop (NeurIPS 2025) Poster