临床自然语言处理中半监督学习自动数据标注的分歧建模
机器学习
2022-06-09 v2 计算与语言
机器学习
摘要
能够提供准确不确定性估计的计算模型对于医疗决策相关的风险管理至关重要。这一点尤为正确,因为许多最先进的系统是使用自动标注(自监督模式)的数据训练的,并且往往过拟合。在本工作中,我们研究了一系列当前最先进预测模型在放射学报告中的观察检测问题上的不确定性估计质量。该问题在医疗领域的自然语言处理中仍研究不足。我们证明,高斯过程(GPs)在基于负对数预测概率(NLPP)评估指标和平均最大预测置信水平(MMPCL)量化 3 种不确定性标签的风险方面提供了优越性能,同时保持了强劲的预测性能。
引用
@article{arxiv.2205.14761,
title = {Modeling Disagreement in Automatic Data Labelling for Semi-Supervised Learning in Clinical Natural Language Processing},
author = {Hongshu Liu and Nabeel Seedat and Julia Ive},
journal= {arXiv preprint arXiv:2205.14761},
year = {2022}
}
备注
7 pages, *Equal contribution