中文

利用提示工程在低资源语言中检测仇恨言语

计算与语言 2025-07-01 v1 人工智能

摘要

社交媒体的快速扩张导致仇恨言语显著增加,这危及个人生活并导致大量仇恨犯罪。检测仇恨言语面临诸多挑战:多样化的方言、频繁的代码混合以及用户生成内容中拼写错误的普遍存在。近期在仇恨言语检测方面的进展通常集中于高资源语言。然而,低资源语言由于缺乏大规模高质量数据集,仍面临重大挑战。本文通过在大型语言模型(LLMs)上进行提示工程,聚焦低资源巴贝尔语,探索如何克服这一限制。我们检验了六种提示策略——零shot 提示、抑制拒绝、致敬分类器、multi-shot 提示、角色提示,以及我们创新的隐喻提示——有效检测低资源语言中的仇恨言语。我们首次创新性地运用隐喻提示规避 LLMs 内置的安全机制,这标志着与现有破解方法的重大不同。我们在 Llama2-7B 模型上测试所有六种提示策略,并与三个预训练词嵌入——GloVe、Word2Vec 和 FastText——在三个深度学习模型(多层感知器 MLP、卷积神经网络 CNN 和双向门控循环单元 BiGRU)上进行大量比较。为证明隐喻提示在低资源巴贝尔语中的有效性,我们还在另一低资源语言——印地语,以及两个高资源语言——英语和德语中进行评估。所有提示技术均使用 F1 分数进行评估,以及环境影响因子(IF),该因子衡量 CO2_2 排放、电力消耗和计算时间。

关键词

引用

@article{arxiv.2506.23930,
  title  = {Leveraging the Potential of Prompt Engineering for Hate Speech Detection in Low-Resource Languages},
  author = {Ruhina Tabasshum Prome and Tarikul Islam Tamiti and Anomadarshi Barua},
  journal= {arXiv preprint arXiv:2506.23930},
  year   = {2025}
}