RefactorCoderQA:面向云端与边缘部署的多域编码问题解答基准
计算与语言
2025-12-29 v2
摘要
为优化大型语言模型(LLM)的推理与问题解决能力,我们提出了一种创新的云端-边缘协作架构,使其能够实现结构化的多智能体提示框架。该框架由三个专用组件组成:GuideLLM—a lightweight模型部署在边缘以提供方法论指导;SolverLLM—a更强大的模型托管在云端,负责生成代码解决方案;以及JudgeLLM—an用于评估解决方案正确性和质量的自动评估器。为评估并展示该架构在真实场景中的有效性,我们引入RefactorCoderQA—a全面的基准,旨在评估和提升LLM在跨域编码任务中的性能。受现有基准局限性的启发,RefactorCoderQA系统地覆盖多个技术领域,包括软件工程、数据科学、机器学习和自然语言处理,使用来自Stack Overflow的真实编码挑战。我们提出RefactorCoder-MoE—a基于DeepSeek-Coder-7B-Instruct的微调混合专家(MoE)代码语言模型,针对RefactorCoderQA基准使用QLoRA进行领域特定编码问题解答。大量实验表明,RefactorCoder-MoE实现了强劲且具竞争力的性能,显著优于所有评估的开源和商业基准,整体准确率达76.84%。
关键词
引用
@article{arxiv.2509.10436,
title = {RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment},
author = {Shadikur Rahman and Aroosa Hameed and Gautam Srivastava and Syed Muhammad Danish},
journal= {arXiv preprint arXiv:2509.10436},
year = {2025}
}
备注
12 pages, 5 figures, Submitted to IEEE Transactions on Services Computing