野生环境中的 NLP 安全与伦理
计算与语言
2025-04-10 v1 人工智能
摘要
随着 NLP 模型被越来越多的终端用户所使用,越来越重要的一个领域是 NLP 安全(NLPSec):评估模型针对恶意攻击的脆弱性,并制定全面的对策。尽管 NLP 与网络安全交叉的工作有望为所有人创建更安全的 NLP,但意外的疏忽可能导致实际危害(例如隐私泄露或恶意模型的传播)。在这一新兴领域,然而,直到此刻,NLP 的研究伦理尚未面对许多与网络安全相关的长期难题。因此,我们审视了 NLPSec 领域的当代著作,探讨其如何参与网络安全的伦理规范。我们在文献中识别出趋势,最终发现在像风险最小化和负责任披露等议题上存在惊人缺口。为缓解这些担忧,我们提供了具体建议,帮助 NLP 研究人员更加伦理地导航此空间,搭建传统网络安全与 NLP 伦理之间的鸿沟,我们将其称为“白帽 NLP”。本文的目标是帮助培育一种意图型的伦理研究文化,以服务于从事 NLP 安全的研究人员。
引用
@article{arxiv.2504.06669,
title = {NLP Security and Ethics, in the Wild},
author = {Heather Lent and Erick Galinkin and Yiyi Chen and Jens Myrup Pedersen and Leon Derczynski and Johannes Bjerva},
journal= {arXiv preprint arXiv:2504.06669},
year = {2025}
}
备注
Accepted to TACL