中文

基于代理模型评估低资源语言中大语言模型的鲁棒性

计算与语言 2025-06-10 v1

摘要

近年来,大语言模型 (LLM) 在各种自然语言处理 (NLP) 任务中展现出惊人的能力。然而,它们对 jailbreak 和扰动的脆弱性 necessitates additional evaluations。许多 LLM 是多语言的,但与安全相关的训练数据主要来自高资源语言,如英语。这会使其对低资源语言(如波兰语)的扰动而显得脆弱。我们展示,通过仅改变少数字符并使用小型代理模型计算词重要性,就能创建出惊人的强大攻击。我们发现,这些字符和词级攻击会显著改变不同 LLM 的预测结果,表明存在可用于规避其内部安全机制的潜在漏洞。我们在波兰语(一种低资源语言)上验证了攻击构建方法,发现 LLM 在该语言中存在潜在漏洞。此外,我们展示了该方法可如何扩展至其他语言。我们发布了创建的数据集和代码,以便进一步研究。

关键词

引用

@article{arxiv.2506.07645,
  title  = {Evaluating LLMs Robustness in Less Resourced Languages with Proxy Models},
  author = {Maciej Chrabąszcz and Katarzyna Lorenc and Karolina Seweryn},
  journal= {arXiv preprint arXiv:2506.07645},
  year   = {2025}
}