稀疏节点引导推理时间对齐
计算与语言
2026-02-26 v1 人工智能
摘要
标记级引导已成为推理时间对齐的关键方法,通过调制其输出分布而无需参数更新来实现对大型语言模型的细粒度控制。虽然有效,但现有方法依赖于每一步的稠密干预。这种持续性操作不仅造成巨大的计算开销,还可能通过过度偏离模型内在分布而损害生成质量。本文我们表明稠密干预是不必要的,提出稀疏推理时间对齐 (SIA),通过仅在生成轨迹的关键决策点进行稀疏节点引导来实现干预。我们的关键洞察是,高熵节点标记生成轨迹中的关键决策点,尤其容易受到误差放大,表明需在这些点引入与对齐相关的奖励信号。广泛的实验在不同模型家族和对齐目标之间显示,仅干预 20% 到 80% 的标记即可实现优异的对齐效率权衡。对于像 Qwen3 这样的强大基础模型,仅干预约 20% 的标记即可匹配甚至超越深度微调指令模型。这一稀疏性实现更强的引导,同时更好地保留模型的原生分布,可无缝集成诸如 Best-of-N 等基于搜索的方法,并将计算成本降低最高可达 6 倍。
引用
@article{arxiv.2602.21215,
title = {Inference-time Alignment via Sparse Junction Steering},
author = {Runyi Hu and Jie Zhang and Shiqian Zhao and Jiale Meng and Jiwei Li and Jason Zeng and Ming Wu and Michael Heinrich and Yonggang Wen and Tianwei Zhang},
journal= {arXiv preprint arXiv:2602.21215},
year = {2026}
}
备注
28 pages, 17 figures