中文

FaithSteer-BENCH:面向部署场景的推理时控制基准测试

人工智能 2026-03-20 v1

摘要

推理时控制因其轻量级且无需额外参数而被广泛视为控制大语言模型(LLM)行为的有效机制,然而现有研究通常在忽略部署约束、能力权衡及实际鲁棒性的松弛评估环境下得出简单激活级干预即可可靠诱导目标行为变化的结论。为此,我们提出 \textbf{FaithSteer-BENCH},通过三个门控指标(可控性、效用保持、鲁棒性)在固定部署式运行点上评估控制方法。我们发现,在标准评估下被大幅掩盖的若干系统性失效模式包括:虚假的可控性、对无关能力的可测认知负荷,以及在轻微指令级扰动、角色提示、编码转换和数据稀缺情况下的显著脆弱性。门控评估结果表明,现有方法在面向部署的实际场景中并不一定能提供可靠的可控性。此外,机制级诊断表明,许多控制方法诱导的是提示条件下的对齐,而非稳定的潜在方向性偏移,从而进一步解释了其在压力测试下的脆弱性。FaithSteer-BENCH 因此为未来方法设计、可靠性评估及部署导向的研究提供了统一的基准框架和更清晰的分析视角。

关键词

引用

@article{arxiv.2603.18329,
  title  = {FaithSteer-BENCH: A Deployment-Aligned Stress-Testing Benchmark for Inference-Time Steering},
  author = {Zikang Ding and Qiying Hu and Yi Zhang and Hongji Li and Junchi Yao and Hongbo Liu and Lijie Hu},
  journal= {arXiv preprint arXiv:2603.18329},
  year   = {2026}
}