Char-mander 使用 mBackdoor!多语言 LLM 中的跨语言后门攻击研究
计算与语言
2025-10-07 v3 人工智能
摘要
我们探索了多语言大语言模型(mLLM)中的跨语言后门攻击(X-BAT),揭示了在一种语言中植入的后门如何通过共享的嵌入空间自动迁移到其他语言。以毒性分类为案例研究,我们证明攻击者可以通过在单一语言中投毒数据来破坏多语言系统,其中罕见和高频 token 作为特定且有效的触发器。我们的发现暴露了一个影响模型架构的关键漏洞,导致信息流中出现隐蔽的后门效应。我们的代码和数据已公开于 https://github.com/himanshubeniwal/X-BAT。
引用
@article{arxiv.2502.16901,
title = {Char-mander Use mBackdoor! A Study of Cross-lingual Backdoor Attacks in Multilingual LLMs},
author = {Himanshu Beniwal and Sailesh Panda and Birudugadda Srivibhav and Mayank Singh},
journal= {arXiv preprint arXiv:2502.16901},
year = {2025}
}