解构聊天中的语码混用:NUS ABC 语码混用语料库
计算与语言
2025-06-17 v2 社会与信息网络
摘要
语码混用涉及在单一话语中无缝整合多种语言的元素,反映了自然的多语言交流模式。尽管它在社交媒体、聊天消息和即时通讯等非正式互动中很突出,但一直缺乏由作者标注且适合用于建模人类对话与关系的公开可用语料库。本研究引入了首个带标注的通用语料库,旨在理解语境中的语码混用,同时保持严格的隐私和伦理标准。我们的在线项目将持续收集、验证并将语码混用消息整合到以 JSON 格式发布的结构化数据集中,并附带详细的元数据和语言学统计。迄今为止,它包含了跨越各种语码混用模式的超过 355,641 条消息,主要关注英语、普通话和其他语言。我们期望该语码混用语料库能作为计算语言学、社会语言学及 NLP 应用研究的基础数据集。
引用
@article{arxiv.2506.00332,
title = {Disentangling Codemixing in Chats: The NUS ABC Codemixed Corpus},
author = {Svetlana Churina and Akshat Gupta and Insyirah Mujtahid and Kokil Jaidka},
journal= {arXiv preprint arXiv:2506.00332},
year = {2025}
}
备注
19 pages, 5 figures, 8 tables