文本分类需要多少词汇量?一种用于词汇选择的变分方法
计算与语言
2019-04-05 v4 机器学习
摘要
随着深度学习的快速发展,深度神经网络已广泛应用于许多现实自然语言应用中。在深度神经网络下,需要预定义词汇表以将文本输入向量化。选择预定义词汇表的典型方法基于词频,通过选定阈值截断长尾分布。然而,我们观察到这种简单方法容易导致词汇量不足或过大的问题。因此,我们有兴趣理解端到端任务分类准确率与词汇量大小的关系,以及达到特定性能所需的最小词汇量是多少。本文中,我们提供了一种基于变分 dropout 的更精细的变分词汇 dropout(VVD)来进行词汇选择,其能智能地选择词汇表子集以达到所需性能。为在新提出的词汇选择问题上评估不同算法,我们提出了两个新指标:准确率-词汇量曲线下面积(Area Under Accuracy-Vocab Curve)和 X\% 准确率下降下的词汇量(Vocab Size under X\% Accuracy Drop)。通过在多个 NLP 分类任务上的大量实验,我们的变分框架在这些指标上显著优于基于频率及其他选择的基线。
引用
@article{arxiv.1902.10339,
title = {How Large a Vocabulary Does Text Classification Need? A Variational Approach to Vocabulary Selection},
author = {Wenhu Chen and Yu Su and Yilin Shen and Zhiyu Chen and Xifeng Yan and William Wang},
journal= {arXiv preprint arXiv:1902.10339},
year = {2019}
}
备注
Accepted to NAACL 2019, 11 pages, 7 figures, 3 tables