英印码混社交媒体内容中的性别预测:语料库与基线系统
计算与语言
2018-06-15 v1
摘要
社交媒体网站使用的迅速扩张导致了大量未处理的用户生成数据,可用于文本挖掘。作者画像是通过文本自动确定作者性别和年龄组等画像属性的任务,在计算语言学中正获得很高关注度。过去大多数作者画像研究集中于英文文本 \cite{1,2}。然而许多用户在社交媒体发帖时经常切换语言,称为码混,这给文本分类和作者画像领域带来了一些挑战,如拼写变化、非语法结构和音译 \cite{3}。线上存在的英印码混社交媒体内容标注数据集很少 \cite{4}。在本文中,我们分析码混内容中作者性别预测任务,并呈现一个从 Twitter 收集的、标注了作者性别的英印文本语料库。我们还探索该语料库中每个词的语言识别。我们提出一个有监督分类基线系统,其使用多种机器学习算法,基于字符和词级特征通过文本识别作者性别。
引用
@article{arxiv.1806.05600,
title = {Gender Prediction in English-Hindi Code-Mixed Social Media Content : Corpus and Baseline System},
author = {Ankush Khandelwal and Sahil Swami and Syed Sarfaraz Akhtar and Manish Shrivastava},
journal= {arXiv preprint arXiv:1806.05600},
year = {2018}
}
备注
10 pages, CiCLing 2018