中文

面向transliterated Bangla的多标签仇恨言论检测数据集 BanTH

计算机视觉与模式识别 2024-10-18 v1

摘要

在数字空间中 transliterated 文本的流行增加了检测和分类超越英语范围内仇恨言论的需求,尤其是针对资源较少的语言。在线论述可能延续基于目标群体(如性别、宗教和起源)的歧视,多标签仇恨言论分类有助于理解仇恨动机并提升内容审查。虽然已有工作聚焦于单语言或二元仇恨分类任务,但尚无人针对 transliterated Bangla 的多标签仇恨言论分类。我们引入 BanTH,首个包含 37.3k 样本的多标签 transliterated Bangla 仇恨言论数据集。样本来源于 YouTube 评论,每个实例标注一个或多个目标群体,反映区域人口学特征。我们通过进一步在 transliterated Bangla 语料上预训练,构建了新的基于变换器编码器的基线模型。我们还提出了一种新颖的基于翻译的大语言模型提示策略,用于处理 transliterated 文本。实验表明,我们的进一步预训练编码器在 BanTH 数据集上实现了最先进的性能,而我们的翻译-based 提示在零样本设置下优于其他策略。BanTH 的引入不仅填补了巴尔贝语仇恨言论研究的关键空白,也为未来探索代码混合和多标签分类在欠代表型语言中的挑战铺平了道路。

关键词

引用

@article{arxiv.2410.13280,
  title  = {Hybrid bundle-adjusting 3D Gaussians for view consistent rendering with pose optimization},
  author = {Yanan Guo and Ying Xie and Ying Chang and Benkui Zhang and Bo Jia and Lin Cao},
  journal= {arXiv preprint arXiv:2410.13280},
  year   = {2024}
}

备注

Photonics Asia 2024