基于推特粉丝资料的短乌尔德文本名人画像分析
社会与信息网络
2025-10-15 v1 人工智能
计算与语言
摘要
社交媒体已成为数字时代的重要组成部分,作为沟通、交互和信息共享的平台。名人是最活跃的用户之一,常通过在线帖子透露个人和职业生活的方方面面。推特等平台提供了分析语言和行为以理解人口统计和社交模式的机会。由于粉丝经常与他们所关注的名人共享语言特征和兴趣,因此可以利用粉丝的文本数据来预测名人的背景特征。然而,大多数现有研究在该领域已聚焦于英语和其他高资源语言,乌尔德语鲜有涉足。本研究将现代机器学习和深度学习技术应用于乌尔德语下名人画像分析问题。收集并预处理了来自次大陆名人粉丝的短乌尔德推文数据集。训练和比较了多种算法,包括逻辑回归、支持向量机、随机森林、卷积神经网络和长短期记忆网络。对模型进行评估,包括准确率、精确率、召回率、F1 分数和累积排名(cRank)。性别预测 achieved 最佳性能,cRank 为 0.65,准确率为 0.65,其后是年龄、职业和名誉预测的中等结果。这一结果表明,粉丝基语言特征可通过机器学习和神经方法有效利用,用于乌尔德语这种低资源语言的人口统计特征预测。
引用
@article{arxiv.2510.11739,
title = {Celebrity Profiling on Short Urdu Text using Twitter Followers' Feed},
author = {Muhammad Hamza and Rizwan Jafar},
journal= {arXiv preprint arXiv:2510.11739},
year = {2025}
}