中文

将中国墙逆向工程技术应用于大语言模型代码编辑

软件工程 2025-07-22 v1 机器学习

摘要

面向编程环境的大型语言模型 (Code LLM) 正在日益普及。尽管具有实用性,但顶级 LLM 的训练数据集仍未公开,这引发了潜在侵犯版权的顾虑。一些模型如 Pleias 和 Comma 强调数据 curated 和许可证,但由于训练数据有限,这些模型不具竞争力,仅作为概念验证。为提高这些模型的实用性,我们提出应用“中国墙”技术,这一灵感来自同名逆向工程技术——使用高质量模型生成详细指令,以供较弱模型执行。通过这种方式,可以使用较弱但 ethically 对齐的模型完成原本只能由更强大模型才能完成的复杂任务。在我们的评估中,我们发现该技术将 Comma v0.1 1T 在 CanItEdit benchmark 中的性能提升超过 66%,Starcoder2 Instruct 约为 20%,而与仅运行基准测试的相同模型相比。然而,由于缺乏基于公共领域内容且无版权限制的数据训练的模型,今天对该技术的实际应用可能受限。

关键词

引用

@article{arxiv.2507.15599,
  title  = {Applying the Chinese Wall Reverse Engineering Technique to Large Language Model Code Editing},
  author = {Manatsawin Hanmongkolchai},
  journal= {arXiv preprint arXiv:2507.15599},
  year   = {2025}
}