中文

EcomGPT-CT:利用半结构化数据对电商大语言模型进行持续预训练

计算与语言 2023-12-27 v1

摘要

在大规模语料库上预训练的大语言模型(LLMs)在各种自然语言处理任务中表现出卓越的性能。然而,将这些模型应用于特定领域仍面临重大挑战,例如缺乏领域知识、利用领域知识的能力有限以及对特定领域数据格式的适应性不足。考虑到从头训练 LLMs 的高昂成本以及特定领域内标注数据的稀缺性,在本工作中,我们专注于以电商领域为例的 LLMs 领域特定持续预训练。具体而言,我们探讨了利用未标注的通用语料库和电商语料库对 LLMs 进行持续预训练的影响。此外,我们设计了一种针对不同数据源的混合策略,以更好地利用电商半结构化数据。我们构建了多个任务来评估 LLMs 在电商领域的少样本上下文学习(In-context Learning)能力及其经过指令微调后的零样本性能。实验结果证明了电商 LLMs 持续预训练的有效性以及我们设计的数据混合策略的成效。

关键词

引用

@article{arxiv.2312.15696,
  title  = {EcomGPT-CT: Continual Pre-training of E-commerce Large Language Models with Semi-structured Data},
  author = {Shirong Ma and Shen Huang and Shulin Huang and Xiaobin Wang and Yangning Li and Hai-Tao Zheng and Pengjun Xie and Fei Huang and Yong Jiang},
  journal= {arXiv preprint arXiv:2312.15696},
  year   = {2023}
}