开放人工知识
计算与语言
2024-07-22 v1 机器学习
摘要
像 ChatGPT、Claude 和 Gemini 这样的基于聊天的 AI 系统取得的巨大成功源于在大量数据集上训练的大语言模型(LLMs)。然而,获取高质量、多样化且来源合乎道德的训练数据仍然是一个重大挑战。我们引入了开放人工知识(OAK)数据集,这是一个拥有超过 5 亿个 token(截至撰写时)的大规模资源,旨在解决这个问题。OAK 利用了一个由最先进 LLMs 组成的集成,包括 GPT4o、LLaMa3-70B、LLaMa3-8B、Mixtral-8x7B、Gemma-7B 和 Gemma-2-9B,以维基百科的主要类别为指导,跨不同领域生成高质量文本。我们的方法确保了广泛的知识覆盖,同时保持了连贯性和事实准确性。OAK 数据集旨在促进能力更强、对齐度更好的语言模型的发展,同时解决 LLM 训练中的数据稀缺和隐私等关键问题,该数据集可在 www.oakdataset.org 上免费获取。
引用
@article{arxiv.2407.14371,
title = {Open Artificial Knowledge},
author = {Vadim Borisov and Richard H. Schreiber},
journal= {arXiv preprint arXiv:2407.14371},
year = {2024}
}