基于全序列与子序列保 conformal 预测的命名实体识别不确定性量化
计算与语言
2026-01-27 v1 机器学习
机器学习
摘要
命名实体识别(NER)作为许多自然语言处理(NLP)管道中的基础组件,然而当前的 NER 模型通常仅输出单一的预测标签序列,且不伴随任何不确定性度量,使下游应用暴露于级联错误的风险。本文引入一种通用框架,用于将基于序列标注的 NER 模型适配为产生不确定性感知预测集。这些预测集是包含正确标注且以用户指定置信水平保证的完整句子标注集合。该方法在经典统计学中类似于置信区间,提供对模型预测可靠性的形式保证。本方法基于保 conformal 预测技术,该技术在最低假设下提供有限样本覆盖保证。我们设计了高效的非拟合得分函数,以构建高效且校准良好的预测集,支持无条件和类别条件的覆盖。该框架考虑了句子长度、语言、实体类型以及句子内实体数量之间的异质性。跨四个 NER 模型进行的实验表明,所提方法在广泛适用性、有效性和效率方面表现出色。
引用
@article{arxiv.2601.16999,
title = {Uncertainty Quantification for Named Entity Recognition via Full-Sequence and Subsequence Conformal Prediction},
author = {Matthew Singer and Srijan Sengupta and Karl Pazdernik},
journal= {arXiv preprint arXiv:2601.16999},
year = {2026}
}