中文

解构不规则语言的鲁棒性:对抗评估与机械解释性洞察

计算与语言 2025-05-14 v1 人工智能

摘要

各种技术用于生成对抗样本,包括TextBugger等方法,引入微小且肉眼难察觉的词语扰动,导致模型行为变化。另一类技术通过替换单词的同义词以保留文本语义但改变预测类别,TextFooler为此类攻击的典范。大多数对抗样本生成方法主要在非不规则语言(通常是英文)上开发和评估。在本工作中,我们评估并解释了对抗攻击在不规则语言中的表现。为阐释不规则性对模型行为及其攻击鲁棒性的影响,我们设计了一种基于机械解释性的方法,使用Edge Attribution Patching(EAP)方法。该评估协议依赖平行任务专用语料库,包含两种语言(波兰语和英文)中均为不规则形式和同形变体的文本。为分析模型并解释不规则性与对抗鲁棒性之间的关系,我们构建了一个新的基准,基于任务导向数据集MultiEmo,使我们能够识别模型中与不规则性相关的电路要素,并分析其在攻击下的行为。

关键词

引用

@article{arxiv.2505.07856,
  title  = {Unpacking Robustness in Inflectional Languages: Adversarial Evaluation and Mechanistic Insights},
  author = {Paweł Walkowiak and Marek Klonowski and Marcin Oleksy and Arkadiusz Janz},
  journal= {arXiv preprint arXiv:2505.07856},
  year   = {2025}
}