社交媒体上库尔德语短文本的医疗数据集分类
计算与语言
2022-04-21 v1
摘要
Facebook 应用被用作收集该数据集评论的资源,该数据集由 6756 条评论组成,以创建医疗库尔德语数据集(MKD)。样本为用户的评论,收集自不同页面(医疗、新闻、经济、教育和体育)的多个帖子。对原始数据集执行了六个步骤的预处理技术,通过替换字符来清理和去除评论中的噪声。这些评论(短文本)被标注为正类(医疗评论)和负类(非医疗评论),作为文本分类。负类的百分比为 55%,而正类为 45%。
引用
@article{arxiv.2204.09660,
title = {Medical Dataset Classification for Kurdish Short Text over Social Media},
author = {Ari M. Saeed and Shnya R. Hussein and Chro M. Ali and Tarik A. Rashid},
journal= {arXiv preprint arXiv:2204.09660},
year = {2022}
}
备注
11 pages