合成函数演示提升低资源编程语言的生成能力
计算与语言
2026-05-13 v2
摘要
训练大语言模型(LLM)时,一个关键考量是目标语言资源的丰富程度,例如英语相对于威尔士语,或 Python 相对于 Excel。编程语言的典型训练数据由真实的程序演示与人工撰写的解释性注释组成。在本工作中,我们针对缺乏自然数据的低资源编程语言,提出一种创建此类数据的新方法。我们的流程生成关于如何使用库函数的、教科书质量的合成演示,我们证明其可作为良好的模型微调数据。我们在 Excel 公式这一示例领域中进行了验证。首先,我们汇集语言文档,然后利用其增强一个强大的教师模型以生成合成训练数据,最后在演示数据上对学生模型进行微调。我们的技术在两个问答数据集上提升了学生模型的表现:WikiTQ 与 TAT-QA。我们还展示了相对于标准 RAG 方法,微调具有优势——后者由于学生模型对目标领域不熟悉,只能带来有限的提升。
引用
@article{arxiv.2503.18760,
title = {Synthetic Function Demonstrations Improve Generation in Low-Resource Programming Languages},
author = {Nick McKenna and Xinnuo Xu and Jack Williams and Nick Wilson and Benjamin Van Durme and Christian Poelitz},
journal= {arXiv preprint arXiv:2503.18760},
year = {2026}
}
备注
Published at LREC 2026