中文

基于余弦相似度的文档向量再探

计算与语言 2022-06-08 v1 人工智能

摘要

IMDB 影评数据集上当前最先进的测试准确率(97.42\%)由 \citet{thongtan-phienthrakul-2019-sentiment} 报道,并通过在其论文中提出的基于余弦相似度的文档向量(DV-ngrams-cosine)与经朴素贝叶斯权重缩放的 N-gram 词袋(BON)向量上训练的逻辑回归分类器实现。尽管大型预训练基于 Transformer 的模型已在许多数据集与任务上展示出 SOTA 结果,上述模型虽更为简单且仅在 IMDB 数据集上预训练,却未被它们超越。本文中,我们描述了该模型评估过程中的一个错误,该错误是当我们试图分析其在 IMDB 数据集上的优异表现时发现的。我们进一步表明先前报道的 97.42\% 测试准确率无效,应更正为 93.68\%。我们还以不同数量的训练数据(IMDB 数据集子集)分析了模型表现,并将其与基于 Transformer 的 RoBERTa 模型比较。结果显示,虽然 RoBERTa 在较大训练集下具有明显优势,但当标注训练集极小时(10 或 20 篇文档),DV-ngrams-cosine 表现优于 RoBERTa。最后,我们为 DV-ngrams-cosine 的训练过程引入了基于朴素贝叶斯权重的子采样方案,其带来更快的训练与更优的质量。

关键词

引用

@article{arxiv.2205.13357,
  title  = {The Document Vectors Using Cosine Similarity Revisited},
  author = {Zhang Bingyu and Nikolay Arefyev},
  journal= {arXiv preprint arXiv:2205.13357},
  year   = {2022}
}