中文

FLUKE:面向鲁棒性评估的语言学驱动且任务无关的框架

计算与语言 2026-02-23 v3 人工智能

摘要

我们提出 FLUKE(Framework for LingUistically-driven and tasK-agnostic robustness Evaluation,即语言学驱动且任务无关的鲁棒性评估框架),用于通过系统性地对测试数据进行最小变异来评估模型鲁棒性。FLUKE 在语言层面引入受控变体,从正字法到方言和语体,利用大型语言模型 (LLM) 配合人类验证生成修改。我们展示了 FLUKE 的实用性,通过在六个多样化 NLP 任务(四个分类任务和两个生成任务)上评估经过微调的模型和 LLM,并发现:(1) 语言变体的影响在任务相关性很大,某些测试对特定任务至关重要,但对其他任务则无关紧要;(2) LLM 对某些语言变体仍表现出显著脆弱性,其中一些推理 LLM 在某些任务上的鲁棒性甚至不如基础模型,规模化仅改善了对表面级修改的鲁棒性;(3) 模型对自然、流畅的修改(如语法或语体变化,尤其是否定)比对抗性测试(如字母翻转)更脆弱;(4) 模型在生成中使用语言特征的能力与其在下游任务上对该特征的鲁棒性不相关。这些发现凸显了进行系统鲁棒性测试的重要性,以理解模型行为。

关键词

引用

@article{arxiv.2504.17311,
  title  = {FLUKE: A Linguistically-Driven and Task-Agnostic Framework for Robustness Evaluation},
  author = {Yulia Otmakhova and Hung Thinh Truong and Rahmad Mahendra and Zenan Zhai and Rongxin Zhu and Daniel Beck and Jey Han Lau},
  journal= {arXiv preprint arXiv:2504.17311},
  year   = {2026}
}

备注

Accepted to EACL 2026 Findings