基于迁移学习的非正式与正式语言场景下的性别识别
计算与语言
2021-07-07 v1 信息检索
摘要
基于文本数据的人口统计信息检索在研究界受到越来越多的关注,因为其在安全、营销、医疗等不同领域已展现出成功应用。基于文本数据识别和判定性别、年龄、位置或个性等人口统计特征,有助于改进不同的营销策略。例如,它使得细分市场和个性化推荐成为可能,从而将产品和服务展示给最感兴趣的群体。这类技术在社交媒体文献中已被广泛讨论。然而,在结构更为正式、无法获取表情符号、提及以及其他仅存在于社交媒体中的语言现象的数据上,相关方法尚缺乏充分研究。本文提出使用循环与卷积神经网络以及一种迁移学习策略,对以非正式和正式语言书写的文档进行性别识别。模型在两个不同的数据库(由推文和呼叫中心对话组成)上进行了测试,两个数据库的准确率均达到 75%。结果还表明,可以将基于特定类型表达或习语(如社交媒体中典型使用的那些)训练的系统知识迁移到更为正式、数据量更稀少且结构完全不同的文本数据上。
引用
@article{arxiv.2107.02759,
title = {Gender Recognition in Informal and Formal Language Scenarios via Transfer Learning},
author = {Daniel Escobar-Grisales and Juan Camilo Vasquez-Correa and Juan Rafael Orozco-Arroyave},
journal= {arXiv preprint arXiv:2107.02759},
year = {2021}
}