大规模网络抽取语料在大型语言模型预训练中的挑战综述
计算与语言
2024-07-11 v1
摘要
本文提出了关于使用大规模网络抽取语料为大型语言模型(LLM)预训练所面临挑战的综合性综述。该综述识别了该领域的关键挑战,包括噪声(无关或误导性信息)、内容重复、低质量或错误信息的存在、偏见以及网络抽取语料中敏感或个人信息的包含。针对这些问题的解决对于开发准确、可靠且在伦理上负责的语言模型至关重要。通过对当前数据清理、预处理、偏见检测和缓解方法的考察,我们突出了现有方法的不足,并提出了未来研究的方向。我们的讨论旨在催化发展更加精细且在伦理上负责的 LLM。
引用
@article{arxiv.2407.07630,
title = {A Review of the Challenges with Massive Web-mined Corpora Used in Large Language Models Pre-Training},
author = {Michał Perełkiewicz and Rafał Poświata},
journal= {arXiv preprint arXiv:2407.07630},
year = {2024}
}
备注
8 pages, Icaisc 2024 conference