打破束缚的 Transformer 模型:任务特定上下文归因有望在不微调预训练大语言模型的情况下提升泛化能力
计算与语言
2024-01-31 v1 人工智能
摘要
在特定数据集上微调大型预训练语言模型(LLMs)是自然语言处理(NLP)分类任务中常用的策略。然而,这种方法通常会导致模型泛化能力的损失。本文提出了一个框架,该框架通过利用任务特定的上下文归因,在保持泛化能力的同时提升下游任务的性能。我们证明,使用任务特定概念算子对任意 Transformer 模型的文本表示进行线性变换,可将其投影到潜在概念空间,本文称之为上下文归因。该特定概念算子在监督学习阶段通过新颖的损失函数进行优化。所提出的框架表明,针对每个任务目标的文本表示进行上下文归因,可以提高判别函数的能力,从而在分类任务中取得更好的性能。在三个数据集(即 HateXplain、IMDB 评论和社交媒体归因)上的实验结果表明,所提出的模型获得了优越的准确率和泛化能力。具体而言,对于在 HateXplain 数据集上未微调的 BERT,我们观察到准确率提高了 8%,F1 分数提高了 10%。而对于 IMDB 数据集,微调后的最先进 XLNet 在准确率和 F1 分数上均被超越 1%。此外,在跨域交叉数据集测试中,结合所提模型在 IMDB 数据集上微调的 DistilBERT,在 HateXplain 数据集上的 F1 分数提高了 7%。对于 YouTube 评论的社交媒体归因数据集,我们观察到 F1 指标提高了 5.2%。所提出的框架使用 PyTorch 实现,并在 GitHub 上开源提供。
引用
@article{arxiv.2401.16638,
title = {Breaking Free Transformer Models: Task-specific Context Attribution Promises Improved Generalizability Without Fine-tuning Pre-trained LLMs},
author = {Stepan Tytarenko and Mohammad Ruhul Amin},
journal= {arXiv preprint arXiv:2401.16638},
year = {2024}
}
备注
8 pages, 3 figures, 5 tables, To be published in 2024 AAAI workshop on Responsible Language Models (ReLM)