用于文本填充与词性预测的保形预测
机器学习
2021-11-05 v1 机器学习
摘要
现代机器学习算法能够提供极为准确的点预测;然而,其统计可靠性仍存在疑问。与传统的机器学习方法不同,保形预测算法返回对应于给定显著性水平的置信集(即集值预测)。此外,这些置信集是有效的,即它们保证了对第一类错误概率的有限样本控制,允许从业者选择可接受的错误率。在我们的论文中,我们针对自然语言数据的文本填充和词性(POS)预测任务,提出了归纳保形预测(ICP)算法。我们为 POS 标注构建了新的保形预测增强的基于 Transformer 的双向编码器表示(BERT)和双向长短期记忆算法,并为文本填充构建了新的保形预测增强的 BERT 算法。我们在包含超过 57,000 个句子的 Brown Corpus 上分析了算法在模拟中的性能。我们的结果表明,ICP 算法能够产生有效的集值预测,且其规模足够小,适用于实际应用。我们还提供了一个真实数据示例,说明我们提出的集值预测如何改进机器生成的音频转录。
引用
@article{arxiv.2111.02592,
title = {Conformal prediction for text infilling and part-of-speech prediction},
author = {Neil Dey and Jing Ding and Jack Ferrell and Carolina Kapper and Maxwell Lovig and Emiliano Planchon and Jonathan P Williams},
journal= {arXiv preprint arXiv:2111.02592},
year = {2021}
}