评估跨语言分类方法:面向多语言社交媒体数据的主题发现
计算与语言
2026-02-20 v1 人工智能
机器学习
摘要
分析多语言社交媒体话语在自然语言处理领域仍是一个重大挑战,尤其当大规模公共辩论跨越多语言且内容杂乱时。本研究探讨了不同方法如何支持对全球对话的可靠分析。以氢能为案例,我们分析了2013至2022年间超九百万篇推文的数据,涵盖英语、日语、印地语和韩语(共计900万+条),用于主题发现。基于在线关键词驱动的数据收集导致大量无关内容。我们探索了四种过滤相关内容的方法:(1) 将英语标注数据翻译至目标语言,为每个目标语言构建语言特定模型;(2) 将来自所有语言的未标注数据翻译至英语,创建基于英语标注的单一模型;(3) 直接将英语微调的多语言变换模型应用于每个目标语言数据;(4) 一种混合策略,结合翻译标注与多语言训练。每种方法均评估其过滤氢能相关推文的能力。随后对相关子集进行主题建模,以提取主导主题。结果揭示了翻译与多语言方法之间的关键权衡,为优化大规模社交媒体分析的跨语言管道提供了可操作性见解。
引用
@article{arxiv.2602.17051,
title = {Evaluating Cross-Lingual Classification Approaches Enabling Topic Discovery for Multilingual Social Media Data},
author = {Deepak Uniyal and Md Abul Bashar and Richi Nayak},
journal= {arXiv preprint arXiv:2602.17051},
year = {2026}
}