CrossTune:基于标签增强的黑盒小样本分类
计算与语言
2024-03-20 v1
摘要
训练或微调大规模语言模型(LLMs)需要大量计算资源,这促使近期研究探索参数高效的下游任务适配。一种方法是将这些模型视为黑盒,并使用前向传递(推理API)与之交互。当前研究聚焦于使用无梯度提示优化将这些黑盒模型适配到下游任务,但这通常涉及搜索任务特定提示的昂贵过程。因此,我们致力于研究无需提示搜索的黑盒语言模型适配。具体而言,我们引入了一种名为CrossTune的标签增强交叉注意力网络,该网络对输入文本序列与任务特定标签描述之间的语义相关性进行建模。其有效性在小样本文本分类场景下得到检验。为提升CrossTune的泛化能力,我们利用ChatGPT通过上下文学习生成额外训练数据。并实现了一个切换机制以排除低质量的ChatGPT生成数据。通过在七个基准文本分类数据集上的广泛实验,我们证明所提方法平均优于先前最先进的无梯度黑盒微调方法5.7%。即使不使用ChatGPT增强数据,CrossTune的性能也优于或可比拟先前的黑盒微调方法,表明了我们方法的有效性。
引用
@article{arxiv.2403.12468,
title = {CrossTune: Black-Box Few-Shot Classification with Label Enhancement},
author = {Danqing Luo and Chen Zhang and Yan Zhang and Haizhou Li},
journal= {arXiv preprint arXiv:2403.12468},
year = {2024}
}
备注
Accepted by LREC-Coling 2024