中文

STARS:面向大语言模型的同步令牌对齐以实现稳健监督

计算与语言 2026-03-04 v2

摘要

与人类价值观对齐是大语言模型 (LLM) 安全部署的关键问题。推理时间技术提供对生成的细粒度控制;然而,它们依赖于模型不确定性,即模型内部估计其下一个令牌或输出正确的可能性,用于分段。我们表明,这引入了两个关键局限性:(a) 面对误校准的自信幻觉的脆弱性,以及 (b) 由于异步、零散批处理导致的硬件利用率不足。这些问题共同降低了对齐可靠性,同时增加了令牌和计算成本,从而限制了其实际可扩展性。为解决这些局限性,基于动态推理时间对齐方法,我们引入 STARS,同步令牌对齐以实现稳健监督,这是一种解码时间算法,通过在固定间隔强制执行验证来引导生成。通过将分段与置信度解耦,STARS 启用了锁定的并行执行并稳健地检测到置信度指标遗漏的错误。在 HH-RLHF 数据集上,我们展示 STARS 在对齐质量方面与最先进的动态方法相当,同时严格限制拒绝成本并最大化系统吞吐量。此外,它在优于微调和几项最先进的推理时间解码策略方面取得显著优势,确立了固定间隔采样作为大规模对齐 LLM 的稳健、系统高效替代方案。代码已公开于 https://github.com/purseclab/STARS。

关键词

引用

@article{arxiv.2511.03827,
  title  = {STARS: Synchronous Token Alignment for Robust Supervision in Large Language Models},
  author = {Mohammad Atif Quamar and Mohammad Areeb and Mikhail Kuznetsov and Muslum Ozgur Ozmen and Z. Berkay Celik},
  journal= {arXiv preprint arXiv:2511.03827},
  year   = {2026}
}