Retriv 在 BLP-2025 任务 2:基于测试驱动的反馈指导的孟加拉到 Python 代码生成框架
计算与语言
2025-11-11 v1
摘要
大型语言模型 (LLM) 已推动了从自然语言提示生成代码的自动化。然而,像孟加拉这样的低资源语言 (LRL) 因限量可用的指令-代码数据集和评估基准而处于欠represented 状态。为此,BLP 工作坊于 IJCNLP-AACL 2025 引入了关于“孟加拉代码生成”的共享任务。本文提出一种方法,将指令提示与使用微调的 Qwen2.5-14B 模型进行测试驱动、反馈指导的迭代细化过程相结合。该模型从孟加拉指令生成代码,测试其对抗单元测试,并通过三次评估迭代细化任何失败的输出,使用测试反馈指导每一步。我们的方法帮助“Retriv”团队在共享任务中获得第二名,Pass@1 分数为 0.934。分析表明,孟加拉指令理解和 Python 代码生成之间存在挑战,强调在 LRL 中需要针对性方法。我们公开了实验脚本供社区使用。
关键词
引用
@article{arxiv.2511.07382,
title = {Retriv at BLP-2025 Task 2: Test-Driven Feedback-Guided Framework for Bangla-to-Python Code Generation},
author = {K M Nafi Asib and Sourav Saha and Mohammed Moshiul Hoque},
journal= {arXiv preprint arXiv:2511.07382},
year = {2025}
}
备注
8 pages, 1 figure, experimental scripts publicly available at https://github.com/NafiAsib/Retriv-BLP25-Task-2