DND:通过动态嵌套深度提升大语言模型性能
计算与语言
2026-01-28 v3 人工智能
摘要
我们介绍Dynamic Nested Depth(DND),一种新型方法,通过选择性地在嵌套深度 manner中重新处理关键token来提升大语言模型(LLM)的性能。具体而言,在给定转换器层的末尾,DND通过一个router识别更关键的token,并将其反馈以进行额外的处理,有效地“审阅”困难的token而避免对更简单token的冗余计算。动态选择机制通过两种新策略实现精确控制:一种控制loss的router以增强token选择的可区分性,以及一种阈值控制方案以确保选择的稳定性。我们通过在预训练稠密模型和Mixture of Experts(MoE)模型中进行后训练阶段的直接集成来展示DND的有效性。在多个基准测试中,该方法以最小的参数和计算增加提升了稠密Qwen3-1.7B模型的性能(提升1.88%),并提升了MoE Qwen3-30B-A3B模型的性能(提升0.87%)。
引用
@article{arxiv.2510.11001,
title = {DND: Boosting Large Language Models with Dynamic Nested Depth},
author = {Tieyuan Chen and Xiaodong Chen and Haoxing Chen and Zhenzhong Lan and Weiyao Lin and Jianguo Li},
journal= {arXiv preprint arXiv:2510.11001},
year = {2026}
}
备注
Accepted by ICLR 2026