中文

超越武器化:面向中低资源语言自身权益的自然语言处理安全

计算与语言 2025-07-08 v1 人工智能

摘要

尽管越来越多的证据表明多语言性可以轻易地被武器化以攻击语言模型,但自然语言处理安全领域的研究仍然 overwhelmingly 以英语为中心。在保障语言模型安全方面,自然语言处理中“英语优先”的规范与网络安全中的标准程序相冲突,后者要求从业者预期并准备应对最坏情况。为了减轻自然语言处理安全中的最坏情况,研究人员必须愿意处理语言模型安全中最薄弱的环节:低资源语言。因此,本工作考察了低资源和中资源语言的语言模型的安全性。我们将现有的对抗性攻击扩展到多达70种语言,以评估单语和多语语言模型在这些语言上的安全性。通过分析,我们发现单语模型的总参数量通常太小,无法确保可靠的安全性,而多语言性虽然有所帮助,但也并不总能保证安全性的提升。最终,这些发现为在低资源语言社区中更安全地部署语言模型提供了重要的考量因素。

关键词

引用

@article{arxiv.2507.03473,
  title  = {Beyond Weaponization: NLP Security for Medium and Lower-Resourced Languages in Their Own Right},
  author = {Heather Lent},
  journal= {arXiv preprint arXiv:2507.03473},
  year   = {2025}
}

备注

Pre-print