中文

通过苏格拉底式引导采样缓解LLM自改进中的尾部收窄

计算与语言 2025-02-24 v2 人工智能 机器学习

摘要

自改进方法使大语言模型(LLM)能够自主生成解决方案,并在过滤后的高质量推理链上迭代训练。这一过程被证明是有效的,减少了LLM推理中对人工监督的依赖,但性能很快达到平台期。我们深入分析该过程,发现模型倾向于对简单查询进行过采样,而对尚未掌握的查询进行欠采样。随着迭代的推进,这种采样不平衡被加剧,导致长尾分布,即困难查询的解决方案几乎消失。这一现象限制了自改进模型的性能提升。最直接的解决方案是暴力采样以平衡分布,但这会显著增加计算成本。在本文中,我们提出了引导自改进(GSI),一种旨在提高挑战性重尾数据采样效率的策略。它利用苏格拉底式引导信号帮助LLM处理复杂查询,减少探索努力并最小化计算开销。在四个模型上针对多样化数学任务的实验表明,GSI 在性能与效率之间取得了平衡,并且在保留任务上也有效。

关键词

引用

@article{arxiv.2411.00750,
  title  = {Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling},
  author = {Yiwen Ding and Zhiheng Xi and Wei He and Zhuoyuan Li and Yitao Zhai and Xiaowei Shi and Xunliang Cai and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2411.00750},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Main Conference. Codes are publicly available at https://github.com/Yiwen-Ding/Guided-Self-Improvement