中文

通过额外训练将特定科学知识注入大型语言模型

计算与语言 2023-12-19 v2 人工智能 机器学习

摘要

通过额外训练,我们探索将专业科学知识嵌入Llama 2大型语言模型(LLM)。关键发现表明,有效的知识整合需要从多个角度阅读文本,尤其是教学格式。我们利用文本增强来解决专业文本的稀缺性,包括风格转换和翻译。超参数优化至关重要,不同大小的模型(7b、13b和70b)合理地进行额外训练。为了验证我们的方法,我们构建了一个包含65,000篇科学论文的数据集。尽管我们成功部分嵌入了知识,但该研究强调了将专业信息纳入LLM的复杂性和局限性,并提出了进一步改进的方向。

关键词

引用

@article{arxiv.2312.03360,
  title  = {Teaching Specific Scientific Knowledge into Large Language Models through Additional Training},
  author = {Kan Hatakeyama-Sato and Yasuhiko Igarashi and Shun Katakami and Yuta Nabae and Teruaki Hayakawa},
  journal= {arXiv preprint arXiv:2312.03360},
  year   = {2023}
}

备注

added token information for some texts, and fixed typo