中文

针对多变量损失函数的文本量化器优化

机器学习 2021-09-21 v2 信息检索

摘要

我们解决了\emph{量化}(quantification)问题,这是一项监督学习任务,其目标是给定一个类别,估计该类别在未标记项数据集中的相对频率(或\emph{流行度},prevalence)。量化在数据和文本挖掘中有多种应用,例如估计一组特定产品评论中正面评论的流行度,或估计技术支持电话录音数据集中特定支持问题的流行度。迄今为止,量化问题通常通过学习通用分类器、统计被分配给该类别的未标记项数量,并根据某些启发式方法调整所得计数来解决。在本文中,我们背离了使用通用分类器的传统,转而使用一种用于\emph{结构化预测}的监督学习模型,该模型能够直接针对用于评估量化准确度的(多变量且非线性的)函数生成优化后的分类器。我们在 5500 个二元高维数据集(平均每个数据集包含超过 14,000 份文档)上进行的实验表明,该方法比现有的最先进量化方法更准确、更稳定且更高效。

关键词

引用

@article{arxiv.1502.05491,
  title  = {Optimizing Text Quantifiers for Multivariate Loss Functions},
  author = {Andrea Esuli and Fabrizio Sebastiani},
  journal= {arXiv preprint arXiv:1502.05491},
  year   = {2021}
}

备注

In press in ACM Transactions on Knowledge Discovery from Data, 2015