KoMultiText:用于真实在线服务中偏见言论分类的大规模韩语文本数据集
计算与语言
2023-11-14 v2
摘要
随着在线服务的发展,对情感分析和偏见文本检测等高级文本分类算法的需求日益凸显。在线服务的匿名性常常导致偏见性和有害语言的出现,对维护在线社区健康构成挑战。这一现象在韩国尤为突出,那里大规模仇恨言论检测算法尚未得到广泛探索。在本文中,我们介绍了“KoMultiText”,一个从知名韩国社交平台收集的新型综合大规模数据集。我们提出的数据集为文本样本提供了包括(1)偏好、(2)亵渎语和(3)九类偏见的标注,支持对用户生成文本进行多任务同步分类。利用最先进的基于 BERT 的语言模型,我们的方法在各种指标衡量下于多种分类任务中超越了人类水平的准确率。除学术贡献外,我们的工作可为真实世界中的仇恨言论与偏见缓解提供实用方案,直接促进在线社区健康的改善。我们的工作为未来旨在提升在线话语质量、增进社会福祉的研究提供了坚实基础。所有源代码与数据集均公开于 https://github.com/Dasol-Choi/KoMultiText。
引用
@article{arxiv.2310.04313,
title = {KoMultiText: Large-Scale Korean Text Dataset for Classifying Biased Speech in Real-World Online Services},
author = {Dasol Choi and Jooyoung Song and Eunsun Lee and Jinwoo Seo and Heejune Park and Dongbin Na},
journal= {arXiv preprint arXiv:2310.04313},
year = {2023}
}
备注
Accepted to the NeurIPS 2023 Workshop on Socially Responsible Language Modelling Research (SoLaR)