中文

跨域数据对德语语言模型的影响

计算与语言 2023-10-16 v2 人工智能 机器学习

摘要

传统上,大语言模型要么在通用网络爬取数据上训练,要么在领域特定数据上训练。然而,生成式大语言模型近期的成功揭示了跨域数据集的益处。为考察优先数据多样性而非质量的重要性,我们提出了一个包含五个领域文本的德语数据集,以及另一个旨在包含高质量数据的数据集。通过在两个数据集上训练参数量介于 122M 和 750M 之间的一系列模型,我们在多个下游任务上进行了全面基准测试。我们的结果表明,在跨域数据集上训练的模型优于仅在质量数据上训练的模型,相较先前最优水平带来最高达 4.45%4.45\% 的提升。这些模型可在 https://huggingface.co/ikim-uk-essen 获取。

关键词

引用

@article{arxiv.2310.07321,
  title  = {On the Impact of Cross-Domain Data on German Language Models},
  author = {Amin Dada and Aokun Chen and Cheng Peng and Kaleb E Smith and Ahmad Idrissi-Yaghir and Constantin Marc Seibold and Jianning Li and Lars Heiliger and Xi Yang and Christoph M. Friedrich and Daniel Truhn and Jan Egger and Jiang Bian and Jens Kleesiek and Yonghui Wu},
  journal= {arXiv preprint arXiv:2310.07321},
  year   = {2023}
}

备注

13 pages, 1 figure, accepted at Findings of the Association for Computational Linguistics: EMNLP 2023