GPT 融合图结构与 KAN 样条:在多任务微调的 GPT-2 上测试新型框架
机器学习
2025-04-16 v1 计算与语言
摘要
我们探讨了将可学习且可解释模块——Specifically Kolmogorov-Arnold Networks (KAN) 和图基表示——集成到预训练 GPT-2 模型中以增强多任务学习准确性的潜力。受近期在链路思考 (CoT) 模型中广泛应用 KAN 和图注意 (GAT) 架构的浪潮及其相对于更简单架构如 MLP 的优势争论的启发,我们首先通过引入低秩适应 (LoRA)、微调超参数和 L2 正则化来增强标准自注意力变换器。该方法取得了显著的改进。为进一步提升可解释性和更丰富的表示,我们开发了两种变体以改进标准 KAN 和 GAT:Graph LoRA 和 Hybrid-KAN LoRA (Learnable GPT)。然而,系统评估表明,这两种变体都不如优化后的 LoRA 增强变换器表现更佳,该模型在 SST 测试集上取得 55.249% 的准确率,在 CFIMDB 开发集上达到 99.18%, paraphrase 检测测试准确率为 89.9%。在莎士比亚十行诗生成方面,我们获得了 CHRF 分数为 42.097。这一发现突显了通过 LoRA 实现的高效参数适应仍是我们任务(情感分析、改写检测和十行诗生成)中最有效的策略。
引用
@article{arxiv.2504.10490,
title = {GPT Meets Graphs and KAN Splines: Testing Novel Frameworks on Multitask Fine-Tuned GPT-2 with LoRA},
author = {Gabriel Bo and Marc Bernardino and Justin Gu},
journal= {arXiv preprint arXiv:2504.10490},
year = {2025}
}
备注
10 pages, 11 figures. This submission cites arXiv:2404.19756. Supplementary materials and additional information are available at arXiv:2404.19756