在多标签文本分类的深度主动学习中利用Beta评分规则的力量
机器学习
2024-01-17 v1 人工智能
摘要
在自然语言处理领域内,多标签文本分类因其标签分布广泛且不均衡而具有独特的挑战性。由于训练先进的深度学习模型需要大量标注数据,尤其是在标注任务可能劳动密集且常需领域特定知识的专业领域,其复杂性进一步加深。为应对这些挑战,我们的研究引入了一种新颖的深度主动学习策略,在期望损失减少框架内利用Beta族适当评分规则。它使用Beta评分规则计算分数的期望增量,然后将其转换为样本向量表示。这些向量表示指导着信息样本的多样化选择,将此过程直接与模型的期望适当分数联系起来。跨合成数据集和真实数据集的综合评估表明,我们的方法在多标签文本分类中通常能够优于已有的采集技术,在各种架构和数据集场景下均展现出令人鼓舞的结果。
引用
@article{arxiv.2401.07395,
title = {Harnessing the Power of Beta Scoring in Deep Active Learning for Multi-Label Text Classification},
author = {Wei Tan and Ngoc Dang Nguyen and Lan Du and Wray Buntine},
journal= {arXiv preprint arXiv:2401.07395},
year = {2024}
}
备注
7 pages AAAI 2024