代码红!对将通用大型语言模型用于编程任务的危害性进行评估
软件工程
2025-04-03 v1 人工智能
摘要
当今开发者日益依赖由大型语言模型(LLM)驱动的解决方案来协助完成编码任务,这使得确保这些工具与人类价值观相匹配、防止恶意滥用至关重要。本文提出了一套全面的框架,用于评估LLM在软件工程领域潜在的危害性。我们首先发展了软件工程情景的有害性分类学,随后创建了基于此分类学的提示词数据集。为系统评估模型响应,我们设计并验证了一种自动评估器,用于对各种LLM(包括开源和闭源模型,通用型和代码专用模型)的输出进行分类。进一步地,我们调查了模型规模、架构家族及对齐策略对其生成有害内容倾向的影响。结果显示,各种LLM在无害性方面存在显著差异。我们发现诸如Openhermes等模型及模型家族比其他模型更危险,而代码专用模型未表现出优于其通用对手等价模型的性能。值得注意的是,一些微调模型因其设计选择而明显劣于基础模型。另一方面,我们发现更大的模型往往更有帮助,且不太可能返回有害信息。这些结果凸显了针对软件工程任务独特挑战实施针对性对齐策略的重要性,并为该关键领域的后续工作奠定了基础。
引用
@article{arxiv.2504.01850,
title = {Code Red! On the Harmfulness of Applying Off-the-shelf Large Language Models to Programming Tasks},
author = {Ali Al-Kaswan and Sebastian Deatc and Begüm Koç and Arie van Deursen and Maliheh Izadi},
journal= {arXiv preprint arXiv:2504.01850},
year = {2025}
}
备注
FSE'25 Technical Track