中文

开放集文本分类系统的不确定性估计

计算与语言 2026-04-13 v1 人工智能

摘要

准确的不确定性估计对于构建稳健可信的识别系统至关重要。本文考虑开放集文本分类(OSTC)任务及其不确定性估计问题。对于OSTC,文本样本应被分类为已有类别或拒绝为未知类别。为 account OSTC遇到的不同不确定性类型,我们将Holistic Uncertainty Estimation(HolUE)方法适用于文本领域。我们的ethods解决文本识别系统中的两个主要预测错误来源:源于不完整查询的文本不确定性,以及与数据分布模糊性相关的画廊不确定性。通过捕获这些来源,即可预测系统何时会进行识别错误。我们提出新的OSTC基准,对广泛的数据进行大规模实验,采用作者归属、意图和主题分类数据集。HolUE在FPIR 0.1处在Yahoo Answers上实现40-365%的预测拒绝比(PRR)提升(0.79 vs 0.17),在DBPedia上提升347%(0.85 vs 0.19),在PAN作者归属上提升240%(0.51 vs 0.15),在CLINC150意图分类上提升40%(0.73 vs ~0.52)。我们公开代码和协议 https://github.com/Leonid-Erlygin/text_uncertainty.git

关键词

引用

@article{arxiv.2604.08560,
  title  = {Uncertainty Estimation for the Open-Set Text Classification systems},
  author = {Leonid Erlygin and Alexey Zaytsev},
  journal= {arXiv preprint arXiv:2604.08560},
  year   = {2026}
}