中文

大型语言模型中毒性的现实评估

计算与语言 2024-05-21 v2 人工智能

摘要

大型语言模型(LLMs)已成为我们专业工作流程和日常生活中不可或缺的组成部分。然而,我们的这些机器伙伴存在一个关键缺陷:赋予它们广博而多样化知识的海量数据,也使其不可避免地暴露于毒性和偏见之中。尽管大多数 LLM 结合了防御机制以防止生成有害内容,但这些安全防护可以通过极少的提示工程轻易绕过。在本文中,我们引入了全新的精心设计毒性(Thoroughly Engineered Toxicity, TET)数据集,包含手工设计的提示,旨在消除此类模型的保护层。通过广泛的评估,我们展示了 TET 在为几种流行 LLM 的毒性感知评估提供严格基准方面发挥的关键作用:它突出了使用正常提示时可能隐藏的 LLM 毒性,从而揭示了其行为中更微妙的问题。

关键词

引用

@article{arxiv.2405.10659,
  title  = {Realistic Evaluation of Toxicity in Large Language Models},
  author = {Tinh Son Luong and Thanh-Thien Le and Linh Ngo Van and Thien Huu Nguyen},
  journal= {arXiv preprint arXiv:2405.10659},
  year   = {2024}
}

备注

Findings of ACL 2024