大语言模型准备好迎接 TOON 了吗?评估新型结构化输出格式中结构正确性与可持续性的权衡
人工智能
2026-01-21 v1 软件工程
摘要
大语言模型(LLMs)越来越多地被要求为下游系统生成结构化的、机器可读的输出。尽管近期的基准测试侧重于评估此类输出的结构正确性,但不同输出格式在推理过程中对环境的影响在很大程度上被忽视了。本文认为,结构化输出格式不仅应从正确性角度评估,还应考虑其环境效率。为此,我们引入了一个可持续性感知的结构化生成评估框架,用于衡量 token 使用量、生成时间和估算的碳排放量。在此框架内,我们提出了环境感知生成正确性分数(GCS_env),这是一个将结构正确性与碳感知效率相结合的统一指标。利用该框架,我们在跨越不同架构和参数规模的多个大语言模型上,系统地将新颖的 TOON 格式与已确立的表示格式(JSON、XML、YAML)进行了基准测试。我们的结果揭示了一个一致的权衡:TOON 能产生显著更紧凑的输出和更低的排放,但当模型缺乏原生支持时,其结构正确性较低。我们表明,提高模型容量可以缩小这一差距,并且环境感知评分可以根据部署优先级改变格式排名。这凸显了将可持续性纳入基准测试的必要性,并提供了实证证据,表明像 TOON 这样的紧凑表示在大规模、具有碳意识的大语言模型部署中具有实际优势。
引用
@article{arxiv.2601.12014,
title = {Are LLMs Ready for TOON? Benchmarking Structural Correctness-Sustainability Trade-offs in Novel Structured Output Formats},
author = {Elio Masciari and Vincenzo Moscato and Enea Vincenzo Napolitano and Gian Marco Orlando and Marco Perillo and Diego Russo},
journal= {arXiv preprint arXiv:2601.12014},
year = {2026}
}