中文

基于模式强化学习的结构化输出生成

计算与语言 2025-03-07 v2

摘要

本研究聚焦于大型语言模型(LLM)生成符合给定模式的有效 JSON 输出的结构化生成能力。尽管 JSON 在将语言模型集成到程序中广泛使用,但对这些能力的系统性分析和基准测试仍不足。我们探讨了 JSON 生成的 various 方面,如结构理解、转义和自然语言描述,以确定如何评估和促进 LLM 生成有效响应。基于此,我们提出 SchemaBench,包含约4万种不同的 JSON 模式,用于获取和评估模型生成有效 JSON 的能力。我们发现最新的 LLM 仍在生成有效 JSON 字符串方面存在挑战。此外,我们展示了将强化学习与细粒度模式验证器结合可进一步提升模型对 JSON 模式的理解,从而提高性能。我们的模型在生成 JSON 输出和下游任务方面均取得显著改进。

关键词

引用

@article{arxiv.2502.18878,
  title  = {Learning to Generate Structured Output with Schema Reinforcement Learning},
  author = {Yaxi Lu and Haolun Li and Xin Cong and Zhong Zhang and Yesai Wu and Yankai Lin and Zhiyuan Liu and Fangming Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2502.18878},
  year   = {2025}
}

备注

8 pages, 4 figures