利用弱监督生成印尼语保护数据集
计算与语言
2023-10-25 v2
摘要
随着对加速自然语言处理(NLP)开发的需求日益增长,弱监督已成为一种快速、大规模创建数据集的有前景的方法。通过利用标注函数,弱监督使从业者能够通过构建产生软标签数据集的学习型标签模型来快速生成数据集。本文旨在展示如何利用这种方法从保护新闻文本构建印尼语NLP数据集。我们构建了两类数据集:多分类与情感分类。随后,我们使用多种预训练语言模型提供了基线实验。这些基线结果显示,情感分类的测试性能为准确率59.79%与F1-score 55.72%,多分类的F1-score-macro为66.87%、F1-score-micro为71.5%、ROC-AUC为83.67%。此外,我们发布了本工作中使用的数据集与标注函数,以供进一步研究与探索。
引用
@article{arxiv.2310.11258,
title = {Utilizing Weak Supervision To Generate Indonesian Conservation Dataset},
author = {Mega Fransiska and Diah Pitaloka and Saripudin and Satrio Putra and Lintang Sutawika},
journal= {arXiv preprint arXiv:2310.11258},
year = {2023}
}