中文

大规模网络抽取语料在大型语言模型预训练中的挑战综述

计算与语言 2024-07-11 v1

摘要

本文提出了关于使用大规模网络抽取语料为大型语言模型(LLM)预训练所面临挑战的综合性综述。该综述识别了该领域的关键挑战,包括噪声(无关或误导性信息)、内容重复、低质量或错误信息的存在、偏见以及网络抽取语料中敏感或个人信息的包含。针对这些问题的解决对于开发准确、可靠且在伦理上负责的语言模型至关重要。通过对当前数据清理、预处理、偏见检测和缓解方法的考察,我们突出了现有方法的不足,并提出了未来研究的方向。我们的讨论旨在催化发展更加精细且在伦理上负责的 LLM。

关键词

引用

@article{arxiv.2407.07630,
  title  = {A Review of the Challenges with Massive Web-mined Corpora Used in Large Language Models Pre-Training},
  author = {Michał Perełkiewicz and Rafał Poświata},
  journal= {arXiv preprint arXiv:2407.07630},
  year   = {2024}
}

备注

8 pages, Icaisc 2024 conference