中文

基于上下文无关语法的领域特定缩写用于生成

计算与语言 2024-06-18 v1

摘要

结构化数据生成是生成式人工智能应用中的关键任务,涉及 JSON、YAML 和 XML 等格式。尽管这些格式广泛使用,但包含许多冗余构造,导致 token 使用膨胀。当采用大型语言模型(如 GPT-4)时,生成大量结构化数据会引发延迟增加和运营成本上升。我们引入一种基于上下文无关语法(CFG)支撑的领域特定缩写(DSS)格式,演示其用于减少结构化数据生成所需的 token 数量。该方法涉及创建一种捕获输出模式基本要素的缩写notation,使其能够无歧义地转换为及从其冗长形式。它运用 CFG 来高效地由 LLM 生成缩写,并创建解析器将缩写翻译回标准结构格式。本方法应用于 LLM 的数据可视化,显示出显著的(3 倍至 5 倍)token 生成减少,导致延迟和成本显著降低。本文概述了 DSS 和附属 CFG 的开发,以及该方法对生成式 AI 应用的影响,呈现了一个可扩展的解决方案,以解决结构化数据生成中的 token 效率问题。

关键词

引用

@article{arxiv.2406.10442,
  title  = {Domain-Specific Shorthand for Generation Based on Context-Free Grammar},
  author = {Andriy Kanyuka and Elias Mahfoud},
  journal= {arXiv preprint arXiv:2406.10442},
  year   = {2024}
}