重新审视基于预训练语言模型的少样本意图分类:直接微调与持续预训练
计算与语言
2024-09-17 v2
摘要
我们考虑少样本意图检测任务,即仅使用少量标注数据训练深度学习模型以根据话语的潜在意图对其进行分类。当前解决该问题的方法是通过持续预训练,即在将预训练语言模型(PLM)用作话语编码器来训练意图分类器之前,先在外部资源(例如对话语料库、公开意图检测数据集或自然语言理解数据集)上对其进行微调。在本文中,我们表明持续预训练可能并非必要,因为 PLM 在该任务上的过拟合问题可能不如预期严重。具体而言,我们发现仅直接在少量标注样本上微调 PLM 已能取得与采用持续预训练的方法相媲美的结果,且随着标注数据数量增加,性能差距迅速缩小。为最大化利用有限的可用数据,我们提出了一种上下文增强方法,并利用序列自蒸馏来提升性能。在真实基准上的综合实验表明,在每类仅给定两个或更多标注样本时,直接微调优于许多利用外部数据源进行持续预训练的强基线。代码可在 https://github.com/hdzhang-code/DFTPlus 获取。
引用
@article{arxiv.2306.05278,
title = {Revisit Few-shot Intent Classification with PLMs: Direct Fine-tuning vs. Continual Pre-training},
author = {Haode Zhang and Haowen Liang and Liming Zhan and Albert Y. S. Lam and Xiao-Ming Wu},
journal= {arXiv preprint arXiv:2306.05278},
year = {2024}
}
备注
ACL 2023, Findings