大型语言模型中毒性的现实评估
计算与语言
2024-05-21 v2 人工智能
摘要
大型语言模型(LLMs)已成为我们专业工作流程和日常生活中不可或缺的组成部分。然而,我们的这些机器伙伴存在一个关键缺陷:赋予它们广博而多样化知识的海量数据,也使其不可避免地暴露于毒性和偏见之中。尽管大多数 LLM 结合了防御机制以防止生成有害内容,但这些安全防护可以通过极少的提示工程轻易绕过。在本文中,我们引入了全新的精心设计毒性(Thoroughly Engineered Toxicity, TET)数据集,包含手工设计的提示,旨在消除此类模型的保护层。通过广泛的评估,我们展示了 TET 在为几种流行 LLM 的毒性感知评估提供严格基准方面发挥的关键作用:它突出了使用正常提示时可能隐藏的 LLM 毒性,从而揭示了其行为中更微妙的问题。
引用
@article{arxiv.2405.10659,
title = {Realistic Evaluation of Toxicity in Large Language Models},
author = {Tinh Son Luong and Thanh-Thien Le and Linh Ngo Van and Thien Huu Nguyen},
journal= {arXiv preprint arXiv:2405.10659},
year = {2024}
}
备注
Findings of ACL 2024