Flick:基于K感知中间学习的少标签文本分类——面向多任务低资源语言
计算与语言
2025-06-13 v1 人工智能
摘要
在极少监督下训练深度学习网络已获得广泛关注,因其有望减少对大规模标注数据的依赖。虽然自训练方法在半监督学习中已被证明有效,但它们仍然容易受到噪声伪标签的错误影响。此外,大多数近期处理少标签分类问题的方法要么针对英语等资源丰富的语言设计,要么涉及复杂的级联模型,容易过拟合。为应对真正低资源语言环境中少标签文本分类的持续挑战——现有方法在此类环境中常因噪声伪标签和领域适应而陷入困境——本文提出了Flick。与依赖通用多聚类伪标签或复杂级联架构的先前方法不同,Flick利用了一个基本洞察:从更广泛的初始聚类集合中蒸馏高置信度伪标签可以显著提升伪标签质量,尤其适用于语言多样的低资源场景。Flick引入了一种新颖的伪标签精炼组件,区别于传统伪标签策略,通过识别并利用表现最优的伪标签聚类来工作。该组件通过聚焦单聚类内聚性并利用自适应Top-k选择机制,专门从初始的广泛聚类集合中蒸馏高度可靠的伪标签。这种针对性的精炼过程对于抑制低资源数据中固有的错误传播至关重要,使得仅用少量真实标签即可对预训练语言模型进行鲁棒的微调。本文在14个多样化数据集上验证了Flick的有效性,涵盖阿拉伯语、乌尔都语和塞茨瓦纳语等具有挑战性的低资源语言以及英语,展示了其优越的性能和适应性。
引用
@article{arxiv.2506.10292,
title = {Flick: Few Labels Text Classification using K-Aware Intermediate Learning in Multi-Task Low-Resource Languages},
author = {Ali Almutairi and Abdullah Alsuhaibani and Shoaib Jameel and Usman Naseem and Gelareh Mohammadi and Imran Razzak},
journal= {arXiv preprint arXiv:2506.10292},
year = {2025}
}