从原子到链条:基于发散引导的无标签LLM领域适应推理课程
机器学习
2026-01-28 v1 人工智能
摘要
无需人工标注数据地将大型语言模型(LLM)适应到特定领域是一个关键但极具挑战性的任务。广泛采用的数据蒸馏方法常常退化为粗糙的模仿,其中学生模型低效地针对自身的弱点进行目标定位,并可能继承教师的推理缺陷。这暴露了一个关键的教育困境:如何在教师本身并非完美专家的情况下制定可靠的课程。我们的工作通过一个关键洞察来解决这一问题:尽管LLM在复杂、整体推理方面可能存在缺陷,但它们在针对性、原子子问题时往往表现出高保真度。基于此,我们提出了一种发散引导推理课程(Divergence-Guided Reasoning Curriculum, DGRC),通过动态从推理路径中的不一致处派生出两种互补课程,从原子知识到推理链条构建学习路径。当学生和教师产生冲突结果时,DGRC会指示教师进行诊断分析:分析两条推理路径以制定针对特定分歧点的原子查询,然后自行回答这些查询以创建高置信度的原子问答对。这些配对双重用途:(1)提供原子课程来纠正学生知识差距,(2)作为事实依据筛选教师的原始推理链,从而产生经验证的CoT课程,以教导学生如何将原子知识整合到完整的推理链条中。在医学和法律领域对不同规模的学生模型进行实验,表明DGRC框架有效。值得注意的是,我们的方法在医学领域对15亿参数的学生模型相对于强大的无标签基线实现了7.76%的相对改进。
引用
@article{arxiv.2601.19588,
title = {From Atoms to Chains: Divergence-Guided Reasoning Curriculum for Unlabeled LLM Domain Adaptation},
author = {Yongqi Wang and Xiaofeng Ji and Jie Wang and Qingbin Li and Xiao Xiong and Zheming Yang and Jian Xu and Minghui Qiu and Xinxiao Wu},
journal= {arXiv preprint arXiv:2601.19588},
year = {2026}
}
备注
Code: https://github.com/bytedance/DGRC