中文

Bangla-English 双语代码混合语料库:用于隐式意义识别的 MixSarc

计算与语言 2026-02-26 v1

摘要

Bangla-English 双语代码混合在南亚社交媒体中广泛存在,但针对该环境下隐式意义识别的资源仍然稀缺。现有的情感和讽刺模型主要关注单语英语或高资源语言,难以处理转写变体、文化背景引用以及句内语言切换。为填补这一差距,我们引入 MixSarc,这是第一个面向隐式意义识别的公开 Bangla-English 双语代码混合语料库。该数据集包含 9,087 条手动标注的句子,标记为幽默、讽刺、冒犯和粗俗。我们通过针对性社交媒体收集、系统筛选和多标注者验证构建了语料库。我们对 transformer-based 模型进行基准测试,并评估了在结构化提示下进行的零样本大语言模型。结果显示,在幽默检测上表现良好,但在讽刺、冒犯和粗俗检测上由于类别不平衡和语用复杂性出现显著下降。零样本模型实现了竞争的微F1分数,但准确率较低。进一步分析显示,外部数据集中超过 42% 的负面情感实例表现出讽刺特征。MixSarc 为在 culturally aware 的 NLP 以及在代码混合环境中实现更可靠的多标签建模提供了基础资源。

关键词

引用

@article{arxiv.2602.21608,
  title  = {MixSarc: A Bangla-English Code-Mixed Corpus for Implicit Meaning Identification},
  author = {Kazi Samin Yasar Alam and Md Tanbir Chowdhury and Tamim Ahmed and Ajwad Abrar and Md Rafid Haque},
  journal= {arXiv preprint arXiv:2602.21608},
  year   = {2026}
}

备注

Under Review