大型语言模型文档打包对隐式多跳推理能力的影响
计算与语言
2025-12-17 v1 人工智能
机器学习
摘要
大型语言模型的训练标准做法是将多个文档打包在一起,以优化计算效率。然而,这一过程对模型能力的影响仍基本未被探索。为弄清这一问题,我们研究了不同的文档打包策略如何影响大型语言模型(LLM)的隐式多跳推理能力。我们的发现表明,与在单个文档上训练相比,打包可以提升模型性能,但代价是更多的计算资源。为进一步理解其背后的机制,我们进行了消融研究,识别出解释打包优势的关键因素。最终,我们的研究深化了对 LLM 训练动力学的理解,并为优化模型开发提供了实际见解。
引用
@article{arxiv.2512.14427,
title = {Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models},
author = {Gabriele Prato and Shagun Sodhani and Alessandro Sordoni and Sarath Chandar},
journal= {arXiv preprint arXiv:2512.14427},
year = {2025}
}