中文

种风收风:编辑语言模型的影响

计算与语言 2024-05-17 v5

摘要

在快速发展的人工智能领域,红队测试或越狱大型语言模型(LLMs)已成为一个关键的研究领域。这种方法在评估和增强这些模型的安全性与鲁棒性方面尤为重要。本文通过模型编辑研究了此类修改的复杂后果,揭示了提升模型准确性与保持其伦理完整性之间的复杂关系。我们的深入分析揭示了一个引人注目的悖论:虽然注入准确信息对于模型可靠性至关重要,但它却可能出人意料地破坏模型的基础框架,导致不可预测且潜在不安全的行为。此外,我们提出了一个基准数据集 NicheHazardQA,用于研究在同一主题领域内和跨主题领域内的这种不安全行为。我们研究的这一部分阐明了编辑如何影响模型的安全指标和护栏。我们的研究结果表明,通过系统地应用针对性编辑并评估由此产生的模型行为,模型编辑可以作为一种用于主题红队测试的高性价比工具。

关键词

引用

@article{arxiv.2401.10647,
  title  = {Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models},
  author = {Rima Hazra and Sayan Layek and Somnath Banerjee and Soujanya Poria},
  journal= {arXiv preprint arXiv:2401.10647},
  year   = {2024}
}

备注

Accepted at ACL 2024