MMT:一个多语言多主题印度社交媒体数据集
计算与语言
2026-01-21 v2 机器学习
社会与信息网络
摘要
社交媒体在跨文化交流中扮演着重要角色。其中大量内容以语码混合与多语言形式出现,给自然语言处理(NLP)工具处理此类信息(如语言识别、主题建模和命名实体识别)带来了重大挑战。为此,我们引入了一个从 Twitter 收集的大规模多语言、多主题数据集(MMT)(170 万条推文),涵盖印度语境下的 13 个粗粒度主题和 63 个细粒度主题。我们进一步从 MMT 数据集中标注了 5,346 条推文的子集,包含多种印度语言及其语码混合对应形式。此外,我们展示了现有工具在主题建模和语言识别两项下游任务上均无法捕捉 MMT 中的语言多样性。为促进未来研究,我们已在 https://huggingface.co/datasets/LingoIITGN/MMT 上提供匿名化并标注的数据集。
引用
@article{arxiv.2304.00634,
title = {MMT: A Multilingual and Multi-Topic Indian Social Media Dataset},
author = {Dwip Dalal and Vivek Srivastava and Mayank Singh},
journal= {arXiv preprint arXiv:2304.00634},
year = {2026}
}
备注
Dataset link: https://huggingface.co/datasets/LingoIITGN/MMT