神经符号系统依然生机勃勃:一种由 LLM 驱动的符号方法,用于更好的代码注释数据生成与分类
软件工程
2024-05-27 v2 人工智能
摘要
我们提出了一种神经符号(NeSy)工作流,结合了基于符号的学习技术与大型语言模型(LLM)代理,以生成用于 C 编程语言代码注释分类的合成数据。我们还展示了如何使用此工作流生成受控合成数据,从而修复了基于 LLM 的生成的一些显著弱点,并提高了经典机器学习模型在代码注释分类任务上的性能。我们的最佳模型(一个神经网络)在数据增强后实现了 91.412% 的 Macro-F1 分数,提升了 1.033%。
引用
@article{arxiv.2402.16910,
title = {NeSy is alive and well: A LLM-driven symbolic approach for better code comment data generation and classification},
author = {Hanna Abi Akl},
journal= {arXiv preprint arXiv:2402.16910},
year = {2024}
}
备注
19 pages, 5 figures, accepted for the GeNeSy workshop at the Extended Semantic Web Conference (ESWC) 2024