中文

MUTEX:利用多语言转换器和条件随机场提升乌尔都语有毒片段检测

计算与语言 2026-03-06 v1 人工智能

摘要

乌尔都语有毒片段检测仍受限于现有系统主要依赖句子级分类,无法识别文本中具体的有毒片段。该问题进一步因缺乏标记级资源、乌尔都语语言复杂性、频繁的代码切换、非正式表达以及丰富的形态变化而加剧。本研究提出MUTEX:一种结合多语言转换器和条件随机场(CRF)的乌尔都语有毒片段检测框架,该框架使用手动标记的标记级有毒片段数据集以提升性能和可解释性。MUTEX采用XLM RoBERTa配合CRF层进行序列标注,并在来自社交媒体、在线新闻和YouTube评论的多领域数据上使用标记级F1分数进行细粒度片段检测。结果表明,MUTEX实现了60%的标记级F1分数,是乌尔都语有毒片段检测的首个监督基线。进一步的分析揭示,基于转换器的模型能够更有效地隐式捕捉上下文有毒性,并且能够解决代码切换和形态变化问题。

关键词

引用

@article{arxiv.2603.05057,
  title  = {MUTEX: Leveraging Multilingual Transformers and Conditional Random Fields for Enhanced Urdu Toxic Span Detection},
  author = {Inayat Arshad and Fajar Saleem and Ijaz Hussain},
  journal= {arXiv preprint arXiv:2603.05057},
  year   = {2026}
}

备注

29 pages, 7 figures, 13 tables