中文

TroubleLLM:与红队专家对齐

人工智能 2024-03-05 v1 计算与语言

摘要

大语言模型(LLM)已成为多种自然语言任务的最先进解决方案,并集成到实际应用中。然而,LLM在表现不良安全问题时可能具有潜在危害,例如社会偏见和有毒内容。在部署前评估其安全性至关重要。然而,现有方法生成的测试提示的质量和多样性仍远未令人满意。这些方法不仅劳动密集且预算成本高,而且对于LLM应用的特定测试领域缺乏测试提示生成的可控性。基于“用LLM测试LLM”的思想,我们提出了首个名为TroubleLLM的LLM,用于生成关于LLM安全问题的可控测试提示。大量实验和人工评估表明,TroubleLLM在生成质量和生成可控性方面具有优越性。

关键词

引用

@article{arxiv.2403.00829,
  title  = {TroubleLLM: Align to Red Team Expert},
  author = {Zhuoer Xu and Jianping Zhang and Shiwen Cui and Changhua Meng and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2403.00829},
  year   = {2024}
}