Anka:用于可靠 LLM 代码生成的领域特定语言
计算与语言
2025-12-30 v1 机器学习
编程语言
软件工程
摘要
大型语言模型 (LLM) 在代码生成方面展现出惊人的能力,但在复杂的多步骤编程任务上表现出系统性错误。我们假设这些错误源于通用语言的灵活性,这种灵活性允许多种有效方法并要求隐式状态管理。为检验此假设,我们引入 Anka,这是一种用于数据转换管道的领域特定语言 (DSL),采用明确、受限语法以减少代码生成中的歧义。尽管 Claude 3.5 Haiku 在 Anka 上没有事先的训练经验,却实现了 99.9% 的解析成功率和 95.8% 的整体任务准确率。关键的是,Anka 在多步骤管道任务上的准确率优于 Python 高出 40 个百分点(100% vs. 60%),其中 Python 的灵活语法导致操作顺序和变量管理常见错误。跨模型验证表明,GPT-4o-mini 也确认了这一优势(多步骤任务提升 26.7 个百分点)。我们的结果表明:(1)LLM 可以从零样本提示中完全学习新 DSL,实现接近本机的准确率;(2)受限语法显著降低了复杂任务中的错误;(3)专为 LLM 生成设计的领域特定语言可优于 LLM 广泛训练的通用语言。我们发布完整的语言实现、基准测试套件和评估框架,以促进进一步研究。
引用
@article{arxiv.2512.23214,
title = {Anka: A Domain-Specific Language for Reliable LLM Code Generation},
author = {Saif Khalfan Saif Al Mazrouei},
journal= {arXiv preprint arXiv:2512.23214},
year = {2025}
}
备注
11 pages, 1 figure, 4 tables. Code and benchmarks available at https://github.com/BleBlo/Anka