中文

LLM 生成的自然语言遇上比例定律:新探索与数据增强方法

计算与语言 2024-07-02 v1

摘要

随着大型语言模型 (LLM) 的兴起,自然语言处理领域见证了诸多改进,例如基于 LLM 的数据增强。然而,先前的研究存在两个主要顾虑:首先,缺乏对 LLM 生成的自然语言 (LLMNL) 是否真正符合人类自然语言 (HNL) 的思考,这是一个关键的基础性问题;其次,增强数据是由 LLM 随机生成的,这暗示并非所有数据都具有相同的训练价值,可能阻碍分类器的性能。为此,我们引入比例定律来内在地计算 LLMNL 与 HNL。通过大量实验,我们揭示了 LLMNL 相对于曼德布洛特定律存在轻微偏差(约 0.2 个曼德布洛特指数),并强调 HNL 的复杂度优势,补充了关于语言风格的解释性讨论。这为 LLM 的扩展奠定了坚实基础。进一步,我们引入一种新型数据增强方法,用于 few-shot 文本分类,称为 ZGPTDA,该方法利用模糊计算机制基于符合比例定律的程度来决定 GPT-4 生成数据的增强。大量实验在真实场景下表明,该方法有效(使 Bert 和 RoBerta 的 F1 分数提高 7-10%)且具竞争力(在 DeBerta 上准确率约高出 2%,优于近期的 AugGPT 和 GENCO 方法)。此外,我们还揭示了一些有趣的见解,例如希尔伯特定律和泰勒定律可为文本分类提供更多好处。

关键词

引用

@article{arxiv.2407.00322,
  title  = {LLM-Generated Natural Language Meets Scaling Laws: New Explorations and Data Augmentation Methods},
  author = {Zhenhua Wang and Guang Xu and Ming Ren},
  journal= {arXiv preprint arXiv:2407.00322},
  year   = {2024}
}