面向实体识别任务的主动学习策略及其评估环境的范围性综述
计算与语言
2024-08-23 v1
摘要
我们对自然语言处理(NLP)领域的主动学习进行了范围性综述,依据PRISMA-ScR指南总结如下:目标:识别用于实体识别的主动学习策略及其评估环境(数据集、指标、硬件、执行时间)。设计:我们使用Scopus和ACM作为检索引擎。我们将结果与两项文献调查进行比较,以评估检索质量。我们纳入了引入或比较实体识别主动学习策略的同行评议英文出版物。结果:我们分析了62篇相关论文,识别出106种主动学习策略。我们将其分为三类:剥 Exploitation-based(60x)、探索-based(14x)和混合策略(32x)。我们发现所有研究均使用F1-score作为评估指标。关于硬件(6x)和执行时间(13x)的信息仅偶尔包含。62篇论文使用了57个不同的数据集来评估其相应的策略。大多数数据集包含报纸文章或生物医学/医学数据。我们的分析显示,57个数据集中有26个是公开可访问的。结论:已识别出大量主动学习策略,以及仍需解决的重要开放问题。研究人员和实践者在就如何选择主动学习策略时面临困难。采用本研究提出的评估环境进行全面实证比较,可能有助于在该领域确立最佳实践。
引用
@article{arxiv.2407.03895,
title = {Scoping Review of Active Learning Strategies and their Evaluation Environments for Entity Recognition Tasks},
author = {Philipp Kohl and Yoka Krämer and Claudia Fohry and Bodo Kraft},
journal= {arXiv preprint arXiv:2407.03895},
year = {2024}
}
备注
The Version of Record of this contribution is published in Deep Learning Theory and Applications 5th International Conference, DeLTA 2024 Proceedings, and will be available after the conference