揭示迁移话语中的语码混合模式:Reddit在线对话的自动检测与分析
计算与语言
2024-06-14 v1 人机交互
信息检索
摘要
全球迁移模式的激增凸显了将移民无缝融入东道社区的紧迫性,这需要包容和值得信赖的公共服务。尽管北欧国家拥有强大的公共部门基础设施,但新移民在获取这些服务时经常遇到障碍,加剧了社会差距并侵蚀了信任。解决数字不平等和语言多样性在此努力中至关重要。本文探讨了语码混合(一种多语者中常见的沟通策略)在Reddit等社交媒体平台迁移相关话语中的利用。我们提出了用于多语言识别语码混合文本的集成学习(ELMICT),这是一种新颖的方法,旨在自动检测迁移相关讨论中的语码混合消息。利用集成学习技术结合多个分词器的输出和预训练语言模型,ELMICT在识别各种语言和上下文中的语码混合方面表现出高性能(F1超过0.95),特别是在跨语言零样本条件下(平均F1超过0.70)。此外,ELMICT的使用有助于分析Reddit上迁移相关线程中语码混合的普遍性,与其他主题类别相比,揭示了移民社区关注的话题。我们的研究结果揭示了移民在社交媒体平台上使用的沟通策略,为开发包容性数字公共服务和对话系统提供了启示。通过解决本研究提出的研究问题,我们有助于理解迁移话语中的语言多样性,并为在多元文化社会中建立信任的更有效工具铺平道路。
引用
@article{arxiv.2406.08633,
title = {Unraveling Code-Mixing Patterns in Migration Discourse: Automated Detection and Analysis of Online Conversations on Reddit},
author = {Fedor Vitiugin and Sunok Lee and Henna Paakki and Anastasiia Chizhikova and Nitin Sawhney},
journal= {arXiv preprint arXiv:2406.08633},
year = {2024}
}
备注
10 pages, 3 figures, Workshop Proceedings of the 18th International AAAI Conference on Web and Social Media