基于 Twitter 的西班牙语语言变体区域化模型
计算与语言
2022-12-13 v3 计算机与社会
社会与信息网络
摘要
西班牙语是全球使用最广泛的语言之一,但不同国家的西班牙语书写与口语方式未必相同。理解局部语言变体有助于提升区域任务上的模型表现,既能理解局部结构,也能改进消息内容。例如,设想一位机器学习工程师在某特定地区自动化语言分类任务,或一位社会科学者试图理解在社交媒体上引起反响的区域性事件;二者均可利用基于方言的语言模型,以更多上下文信息从而更高精度理解正在发生之事。本文呈现并描述了一套基于四年间 26 个西班牙语国家地理标记 Twitter 公开消息构建的西班牙语区域化资源。我们引入了基于 FastText 的词嵌入、基于 BERT 的语言模型,以及按区域划分的语料样本。我们还提供了覆盖词汇与语义相似性的广泛跨区域比较,以及区域资源在消息分类任务上的应用示例。
引用
@article{arxiv.2110.06128,
title = {Regionalized models for Spanish language variations based on Twitter},
author = {Eric S. Tellez and Daniela Moctezuma and Sabino Miranda and Mario Graff and Guillermo Ruiz},
journal= {arXiv preprint arXiv:2110.06128},
year = {2022}
}