中文

分布式文档表示的可压缩性

计算与语言 2021-10-15 v1 人工智能 机器学习

摘要

当代自然语言处理 (NLP) 围绕从隐式文档表示中学习展开,这些表示或由神经语言模型隐式生成,或由 doc2vec 等方法显式生成。所得表示的关键属性之一是其维度。尽管通常采用的 256 维和 768 维在许多任务上提供了足够的性能,但默认维度是否是最适合后续下游学习任务的选择,往往并不明确。此外,由于计算限制,表示维度很少进行超参数调优。本文旨在证明,一个出奇简单且高效的递归压缩过程,不仅足以显著压缩初始表示,而且在考虑文本分类任务时,还可能提升其性能。在部署阶段,拥有更小且噪声更少的表示是理想特性,因为数量级更小的模型可以显著减少计算开销,从而降低部署成本。我们提出 CoRe,一个直接且与表示学习器无关的框架,适用于表示压缩。CoRe 的性能在来自生物医学、新闻、社交媒体和文学领域的 17 个真实语料库集合上进行了展示和研究。我们探索了 CoRe 在考虑上下文和非上下文文档表示、不同压缩级别以及 9 种不同压缩算法时的行为。当前基于超过 100,000 次压缩实验的结果表明,递归奇异值分解在压缩效率和性能之间提供了非常好的权衡,使得 CoRe 在许多现有的、依赖表示的 NLP 流程中非常有用。

关键词

引用

@article{arxiv.2110.07595,
  title  = {Compressibility of Distributed Document Representations},
  author = {Blaž Škrlj and Matej Petkovič},
  journal= {arXiv preprint arXiv:2110.07595},
  year   = {2021}
}

备注

Accepted to ICDM2021