中文

DIVE:多样化的迭代自我改进

计算与语言 2025-01-03 v1

摘要

最近的大语言模型(LLM)进展显示了迭代自我改进(Iterative Self-Improvement, ISI)技术的有效性。然而,持续对自生成数据进行训练会导致输出多样性下降,这在推理任务中尤其关键,因为 diverse solution paths(多样化解题路径)是必需的。我们提出DIVE(Diversified Iterative Self-Improvement,多样化迭代自我改进),一个通过两个关键组件来解决这一挑战的新框架:用于更广泛解题探索的样本池扩充,以及用于在偏好对中平衡多样性和质量的数据选择。在MATH和GSM8k数据集上的实验表明,DIVE在保持与vanilla ISI相当的性能质量的同时,实现了10%至45%的输出多样性提升。我们的消融研究确认了这两项组件在实现这些改进方面的重要性。代码可在https://github.com/qinyiwei/DIVE获取。

关键词

引用

@article{arxiv.2501.00747,
  title  = {DIVE: Diversified Iterative Self-Improvement},
  author = {Yiwei Qin and Yixiu Liu and Pengfei Liu},
  journal= {arXiv preprint arXiv:2501.00747},
  year   = {2025}
}