中文

基于熵的自训练自适应加权

计算与语言 2025-04-01 v1

摘要

大语言模型的数学问题解决能力日益成为研究焦点,越来越多的人关注利用自生成推理路径以增强这些模型。这些路径在仅需监督正确答案的情况下捕捉逐步的逻辑过程。自训练方法在推理任务中表现有效,同时消除了对外部模型和手动标注的需求。然而,优化自生成数据用于模型训练仍是开放挑战。本文提出基于熵的自训练自适应加权策略(EAST),旨在优先处理不确定的数据进行自训练。具体而言,EAST 采用带可调参数的映射函数控制加权锋利程度,将模型 exhibits greater uncertainty 时的数据赋予更高权重。这一方法引导模型聚焦于更具信息性和更具挑战性的示例,从而提升其推理能力。我们在 GSM8K 和 MATH 数据集上评估了该方法。实验结果表明,vanilla 方法在 MATH 上几乎无改进(0%),而 EAST 实现约 1% 的提升。在 GSM8K 上,EAST 比 vanilla 方法再提升 1-2%。

关键词

引用

@article{arxiv.2503.23913,
  title  = {Entropy-Based Adaptive Weighting for Self-Training},
  author = {Xiaoxuan Wang and Yihe Deng and Mingyu Derek Ma and Wei Wang},
  journal= {arXiv preprint arXiv:2503.23913},
  year   = {2025}
}