协作代码生成模型的承诺与危险:在有效性与记忆之间取得平衡
软件工程
2024-09-19 v1 人工智能
机器学习
摘要
在快速发展的机器学习领域,使用来自不同位置和组织的数据集训练模型由于隐私和法律问题,面临着显著的挑战。能够有效利用分布式和孤立数据集中有价值知识的协作训练设置的探索日益至关重要。本研究调查了影响协作训练方法在代码 next-token 预测中有效性的关键因素,以及生成代码的正确性和实用性,展示了此类方法的潜力。此外,我们评估了不同参与者训练数据在各种协作训练设置下的记忆情况,包括集中式、联邦和增量训练,突显了其在泄露数据方面的潜在风险。我们的发现表明,代码数据集的规模和多样性是影响协作训练代码模型成功的关键因素。我们展示了联邦学习在实现与集中训练相当的性能方面取得了竞争成绩,同时提供了更好的数据保护,如下文中所示,生成代码中的记忆比率更低。然而,联邦学习仍然可能从隐藏的训练数据中生成逐字代码片段, potentially 违反隐私或版权。我们进一步探讨了增量学习中的有效性和记忆模式,强调单个参与者数据集引入的顺序。我们还识别出跨组织克隆作为集中式和联邦学习情景中普遍的挑战。我们的发现表明,即使训练数据未被看到,推理期间仍然存在数据泄露的风险。我们以对实践者和研究人员的建议结束,以优化多源数据集,推动跨组织合作前进。
引用
@article{arxiv.2409.12020,
title = {Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization},
author = {Zhi Chen and Lingxiao Jiang},
journal= {arXiv preprint arXiv:2409.12020},
year = {2024}
}
备注
Paper accepted to the ASE 2024 Conference Research Track