ToReMi:用于动态预训练数据选择的主题感知数据重加权
计算与语言
2025-04-22 v3
摘要
预训练大型语言模型(LLM)需要庞大的多样化文本语料库,使得有效的数据选择成为平衡计算资源与模型性能之间的关键挑战。当前方法主要侧重于数据质量指标和混合比例,却未能充分捕捉训练样本与各个领域内部质量差异之间的潜在语义联系。我们提出 ToReMi(Topic-based Reweighting for Model improvement),一个新的两阶段框架,根据样本的主题关联性和观察到的学习模式动态调整训练样本权重。我们的全面实验表明,ToReMi 变体在各种预训练方法上 consistently 实现卓越的性能,展示了在多个领域加速的困惑度降低,并在下游评估任务中提升了能力。代码可在 https://github.com/zxx000728/ToReMi 获取。
引用
@article{arxiv.2504.00695,
title = {ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection},
author = {Xiaoxuan Zhu and Zhouhong Gu and Baiqian Wu and Suhang Zheng and Tao Wang and Tianyu Li and Hongwei Feng and Yanghua Xiao},
journal= {arXiv preprint arXiv:2504.00695},
year = {2025}
}