AVSD:通过平衡共识与教师特定特权信号实现自适应视图自蒸馈
机器学习
2026-05-21 v1 人工智能
计算与语言
摘要
自蒸馈使语言模型能够通过使用相同模型作为学生和教师,从自身轨迹中进行 on-policy 学习,教师根据学生不可获取的特权信息进行条件化。这种信息可以以不同类型或视图形式出现,例如解决方案、演示、反馈或最终答案。该设置在不依赖单独外部模型的情况下提供密集的 token 级反馈,但会创建根本性的不对称:教师可能依赖视图特定的信息,而学生在推理时无法获取。此外,最佳特权信息类型往往是任务相关的,难以选择单一的教师视图。为同时解决这两个挑战,我们引入了 AVSD(自适应视图自蒸馈),一种具有多个特权信息视图的自蒸馈新方法,通过分离跨视图共识信号和视图特定残差信号来重构 token 级监督。AVSD 识别跨视图共享的共识信号,这提供可靠的更新方向,然后在其与共识方向对齐且与共识信号比例适当时,选择性地添加视图特定的残差信号以调整更新幅度。在数学竞赛基准(AIME24、AIME25 和 HMMT25)上的实验表明,AVSD 在所有单视图自蒸馈基线和 GRPO 上 consistently 获胜,在 Qwen3-8B 和 Qwen3-4B 上分别实现平均 Avg@8 提升 3.1% 和 2.2%。此外,在使用 Qwen3-8B 的代码生成基准(Codeforces、LiveCodeBench v6)上,AVSD 在平均情况下比单视图自蒸馈基线提升 2.4%。
引用
@article{arxiv.2605.20643,
title = {AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals},
author = {Duy Nguyen and Hanqi Xiao and Archiki Prasad and Zaid Khan and Anirban Das and Austin Zhang and Sambit Sahu and Hyunji Lee and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2605.20643},
year = {2026}
}
备注
Code: https://github.com/duykhuongnguyen/AVSD