基于开源人工智能的软件工程工具:协作式软件学习的机遇与挑战
软件工程
2024-04-10 v1 人工智能
摘要
大型语言模型(LLMs)已成为推进软件工程(SE)任务的关键工具,在代码理解及其他方面展示了其有效性。与传统软件工程工具一样,开源协作是实现优秀产品的关键。然而,对于人工智能模型,核心需求在于数据。这些基于人工智能的软件工程模型的协作依赖于最大化高质量数据的来源。然而,数据,尤其是高质量数据,通常具有商业或敏感价值,使得开源人工智能软件工程项目难以获取。这一现实对软件工程社区内基于人工智能的软件工程工具的开发和改进构成了重大障碍。因此,研究人员需要找到解决方案,使开源人工智能软件工程模型能够利用不同组织的资源。针对这一挑战,我们的立场论文研究了一种解决方案,以促进开源人工智能模型访问多样化的组织资源,同时确保隐私和商业敏感性得到尊重。我们引入了一个以联邦学习(FL)为核心的治理框架,旨在促进开源人工智能代码模型的联合开发和维护,同时保护数据隐私和安全。此外,我们为开发者提供了基于人工智能的软件工程工具协作指南,涵盖数据需求、模型架构、更新策略和版本控制。鉴于数据特征对联邦学习的显著影响,我们的研究考察了代码数据异质性对联邦学习性能的影响。
引用
@article{arxiv.2404.06201,
title = {Open-Source AI-based SE Tools: Opportunities and Challenges of Collaborative Software Learning},
author = {Zhihao Lin and Wei Ma and Tao Lin and Yaowen Zheng and Jingquan Ge and Jun Wang and Jacques Klein and Tegawende Bissyande and Yang Liu and Li Li},
journal= {arXiv preprint arXiv:2404.06201},
year = {2024}
}