利用用户频率信息从社交媒体文本中挖掘地域用语
计算与语言
2019-07-11 v1
摘要
检测地域用语(在特定地区使用的表达或词汇)的任务传统上依赖问卷与调查,且严重依赖调查者的专业知识与直觉。社交媒体的兴起及其微博服务产生了空前丰富的内容,主要是用户生成的 informal 文本,为语言学家拓展语言变异研究提供了新机遇。先前关于地域用语自动检测的工作主要依赖词频。本工作中,我们提出一种基于信息论、融合用户频率的新颖度量。我们在阿根廷西班牙语推文语料上以两种方式检验该度量:通过对检索词相关性的人工标注,以及作为用户地理定位的特征选择方法。无论何种方式,我们的度量均优于仅基于词频的其他技术,表明度量产生某词的用户数量具有信息量。该工具已帮助词典编纂者发现若干未登记的阿根廷西班牙语词汇,以及已登记词汇的不同释义。
引用
@article{arxiv.1907.04492,
title = {Exploiting user-frequency information for mining regionalisms from Social Media texts},
author = {Juan Manuel Pérez and Damián E. Aleman and Santiago N. Kalinowski and Agustín Gravano},
journal= {arXiv preprint arXiv:1907.04492},
year = {2019}
}