精度与召回约束下短文本自动主题标引的基于内容的质量估计
信息检索
2018-06-08 v1 数字图书馆
摘要
语义标注必须满足质量约束才能对数字图书馆有用,这在大型且多样的数据集上尤其具有挑战性。多标签分类方法的置信度分数通常仅指代特定主题的相关性,而忽略文档层面内容表示不足的指示量。因此,我们提出一种新方法,检测满足质量标准的文档而非概念。我们的方法使用深度多层回归架构,其包含多种基于内容的指示量。我们使用来自法律和经济领域的文本集合评估了多种配置,其中可用内容仅限于极短文本。值得注意的是,我们证明了所提出的质量估计技术能够确定先前未见过数据的子集,在其中可实现文档级召回率的显著增益,同时保持精度。因此,该方法有效地执行了一种过滤,确保了运行中的信息检索系统中的高数据质量标准。
引用
@article{arxiv.1806.02743,
title = {Content-Based Quality Estimation for Automatic Subject Indexing of Short Texts under Precision and Recall Constraints},
author = {Martin Toepfer and Christin Seifert},
journal= {arXiv preprint arXiv:1806.02743},
year = {2018}
}
备注
authors' manuscript, paper submitted to TPDL-2018 conference, 12 pages