中文

逆袭:在多语言嵌入反转攻击中克服词汇类型、书写系统与语言混淆

计算与语言 2024-12-17 v2 密码学与安全

摘要

大型语言模型(LLMs)通过诸如对抗性攻击、后门攻击和嵌入反转攻击等入侵方式容易受到网络攻击者的恶意影响。应对这些威胁,LLM安全领域不断发展,以研究和防御此类攻击。迄今为止,该领域的大多数研究工作都集中在单一语言的英语模型上,但最新的研究表明,多语言LLMs可能比其单一语言对手更容易受到各种攻击的影响。虽然先前的工作在欧洲语言的小子集上研究了嵌入反转,但将这些发现外推到不同语言族和不同书写系统的语言具有挑战性。为此,我们探讨了在嵌入反转攻击语境下多语言LLMs的安全性,并研究了跨语言和跨书写系统的反转,涵盖20种语言,覆盖超过8个语言族和12种书写系统。我们的发现表明,使用阿拉伯文字和西里尔文字的语言在嵌入反转方面尤其脆弱,印度-阿拉伯语族中的语言亦是如此。我们进一步观察到,反转模型倾向于出现语言混淆,有时会大大降低攻击的有效性。因此,我们系统性地探索了这种瓶颈,发现可被攻击者利用的可预测模式。最终,这项研究旨在进一步了解面临多语言LLMs安全漏洞的现状,并提高对这些攻击中最易受负面影响的语言的意识。

关键词

引用

@article{arxiv.2408.11749,
  title  = {Against All Odds: Overcoming Typology, Script, and Language Confusion in Multilingual Embedding Inversion Attacks},
  author = {Yiyi Chen and Russa Biswas and Heather Lent and Johannes Bjerva},
  journal= {arXiv preprint arXiv:2408.11749},
  year   = {2024}
}

备注

11 pages, 4 figures, 7 tables