中文

Something Just Like TRuST:跨域与目标的有害语言识别

计算与语言 2026-01-07 v2 人工智能

摘要

有害语言包括冒犯、滥用或倡导伤害的内容。大语言模型(LLMs)防有害输出的进展受到不一致的有害定义限制。我们引入 TRuST,一个大型数据集,通过仔细综合的有害定义和相应的注释方案统一并扩展了先前资源。数据集包含约 30 万 项注释,其中约 1.1 万 项为高质量的人类注释。为确保高质量,我们设计了严格的多阶段人类注释流程,并评估了注释者的多样性。随后我们在三个任务上对 state-of-the-art LLMs 和 pre-trained models 进行基准测试:有害检测、目标群体识别以及有害词识别。我们的结果表明,微调的 PLMs 在三个任务上均优于 LLMs,且当前推理模型未能可靠地提升性能。TRuST 是评估和缓解 LLM 有害性、以及其他社会意识和更安全语言技术研究中最全面的资源之一。

关键词

引用

@article{arxiv.2506.02326,
  title  = {Something Just Like TRuST : Toxicity Recognition of Span and Target},
  author = {Berk Atil and Namrata Sureddy and Rebecca J. Passonneau},
  journal= {arXiv preprint arXiv:2506.02326},
  year   = {2026}
}