中文

IndoToxic2024: 针对印尼语言仇恨言语与毒性类型的人口学丰富数据集

计算与语言 2025-06-13 v2 人工智能

摘要

仇恨言语构成对社会和谐的严重威胁。过去两年间, 印尼的线上仇恨言语比例增长了十倍, 凸显了亟需有效检测机制的紧迫性。然而, 由于印尼文本缺乏标注数据, 进展受阻。对边缘少数群体(如什叶派、LGBTQ及其他族裔少数派)而言, 仇恨言语更容易被忽视和低估, 且检测工具难以理解。此外, 当前数据集未充分考虑主观性因素, 加剧了这一问题。为此, 我们引入IndoToxic2024, 一个全面的印尼仇恨言语与毒性分类数据集。该数据集包含43,692条条目, 由19名来自不同背景的标注者标注, 聚焦于针对印尼脆弱群体的文本, 特别是当选举总统期间最为激烈的时刻。我们为七个二分类任务建立了基线, 使用经过微调的BERT模型(IndoBERTweet)实现仇恨言语分类, 宏平均F1分数达到0.78。此外, 我们展示了将人口学信息纳入其中可提升大型语言模型(gpt-3.5-turbo)的零样本性能。然而, 我们也警告过度依赖人口学信息可能对微调模型性能产生负面影响, 由于数据碎片化。

关键词

引用

@article{arxiv.2406.19349,
  title  = {IndoToxic2024: A Demographically-Enriched Dataset of Hate Speech and Toxicity Types for Indonesian Language},
  author = {Lucky Susanto and Musa Izzanardi Wijanarko and Prasetia Anugrah Pratama and Traci Hong and Ika Idris and Alham Fikri Aji and Derry Wijaya},
  journal= {arXiv preprint arXiv:2406.19349},
  year   = {2025}
}

备注

This work has been substantially expanded and finalized as IndoDiscourse (see [https://huggingface.co/datasets/Exqrch/IndoDiscourse]). IndoToxic should be considered a draft/precursor version and is no longer maintained