面向可信代码生成的大语言模型:数据中心协同审计框架
软件工程
2024-12-17 v2
摘要
LLM 驱动的代码和开发助手已广泛应用于程序员的工作流程中。然而,尽管其应用广泛,关于大语言模型在代码领域可信度的担忧仍然存在。现有研究多聚焦于训练或评估,导致关于训练与评估各方对模型可信度理解是否一致,以及是否能朝着统一方向推进的疑问。本文提出一种统一的可信度审计框架 DataTrust,采用数据中心方法,协同强调训练数据与评估数据的关联性。DataTrust 旨在将评估中模型可信度指标与训练中数据质量指标相连接。它自主检查训练数据,并通过合成数据评估模型可信度,将特定评估数据导致的可信度问题归因于相应的训练数据,从而细化指标之间的关联。此外,一个由 DataTrust 驱动的可信度竞技场将吸纳众包输入并提供量化结果。我们阐述了 DataTrust 各利益相关方可获益的益处,并讨论了其所面临的挑战与机遇。
引用
@article{arxiv.2410.09048,
title = {Towards Trustworthy LLMs for Code: A Data-Centric Synergistic Auditing Framework},
author = {Chong Wang and Zhenpeng Chen and Tianlin Li and Yilun Zhao and Yang Liu},
journal= {arXiv preprint arXiv:2410.09048},
year = {2024}
}
备注
Short Vision Paper, Accepted by ICSE'25-NIER