超越模板:基于可行性感知探索的推理演示动态适应
计算与语言
2025-05-28 v1
摘要
大型语言模型 (LLM) 展现出惊人的推理能力,但由于分布性差异和模型容量有限,仍面临将其能力对齐到小型语言模型 (SLM) 的挑战。现有的推理数据集通常为强大 LLM 设计,导致直接应用于较弱模型时性能下降。在本工作中,我们引入 Dynamic Adaptation of Reasoning Trajectories (DART),一种新型数据适应框架,用于弥合专家推理轨迹与多样化 SLM 之间的能力差距。DART 采用由解题仿真用于步骤可适应性估计的选择性模仿策略。当专家步骤超出学生能力时——由仿真差距 (Imitation Gap) 信号表明——学生会自主探索受结果一致性约束的替代推理路径。我们在多个推理基准测试和模型规模上验证了 DART,证明其在静态微调上显著提升了泛化能力和数据效率。该方法通过将训练信号与学生推理能力对齐,提升了监督质量,为资源受限模型的推理对齐提供了可扩展解决方案。
引用
@article{arxiv.2505.20700,
title = {Beyond Templates: Dynamic Adaptation of Reasoning Demonstrations via Feasibility-Aware Exploration},
author = {Yong Wu and Weihang Pan and Ke Li and Chen Binhui and Ping Li and Binbin Lin},
journal= {arXiv preprint arXiv:2505.20700},
year = {2025}
}