中文

GPT-Neo 大语言模型仿真语料库中的希普斯定律

计算与语言 2023-11-14 v1

摘要

希普斯定律是文本分析中的一条经验关系,用于预测词汇量随语料库规模的增长。尽管该定律已在多种人类撰写的文本语料库中得到验证,但其对大语言模型生成文本的适用性仍未被探索。本研究填补了这一空白,聚焦于使用 GPT-Neo 大语言模型套件对语料库进行仿真。为开展调查,我们使用三种不同参数规模的 GPT-Neo 模型仿真了 PubMed 摘要语料库。我们的仿真策略是使用每篇 PubMed 摘要的前五个词作为提示,并指示模型将内容扩展至原摘要长度。我们的发现表明,生成的语料库遵循希普斯定律。有趣的是,随着 GPT-Neo 模型规模增大,其生成的词汇量越来越遵循如人类撰写文本中所观测到的希普斯定律。为了进一步提升 GPT-Neo 输出的丰富性与真实性,未来的迭代可着重扩大模型规模或改进模型架构以减少词汇重复。

关键词

引用

@article{arxiv.2311.06377,
  title  = {Heaps' Law in GPT-Neo Large Language Model Emulated Corpora},
  author = {Uyen Lai and Gurjit S. Randhawa and Paul Sheridan},
  journal= {arXiv preprint arXiv:2311.06377},
  year   = {2023}
}

备注

4 pages, 1 figure, 1 table, EVIA 2023