重访大语言模型的输入扰动问题:面向噪声槽填充任务的统一鲁棒性评估框架
计算与语言
2023-10-11 v1 人工智能
机器学习
摘要
随着大语言模型(LLMs)能力的不断提升,这些高性能模型在广泛的自然语言处理(NLP)任务上已取得最先进的成果。然而,模型在常用基准数据集上的表现往往无法准确反映其在真实世界噪声数据下的可靠性和鲁棒性。为应对这些挑战,我们提出一个基于槽填充任务的统一鲁棒性评估框架,以系统评估 LLMs 在多种输入扰动场景下的对话理解能力。具体而言,我们构建了输入扰动评估数据集 Noise-LLM,包含五类单一扰动和四类混合扰动数据。此外,我们利用多层次数据增强方法(字符、词和句子层面)构建候选数据池,并精心设计两种自动任务示例构建策略(实例级和实体级)及多种提示模板。我们的目标是评估 LLMs 各类鲁棒性方法在真实噪声场景中的表现。实验表明,当前开源 LLMs 的扰动鲁棒性表现普遍有限。基于这些实验观察,我们提出若干前瞻性建议以推动该方向的研究。
引用
@article{arxiv.2310.06504,
title = {Revisit Input Perturbation Problems for LLMs: A Unified Robustness Evaluation Framework for Noisy Slot Filling Task},
author = {Guanting Dong and Jinxu Zhao and Tingfeng Hui and Daichi Guo and Wenlong Wan and Boqi Feng and Yueyan Qiu and Zhuoma Gongque and Keqing He and Zechen Wang and Weiran Xu},
journal= {arXiv preprint arXiv:2310.06504},
year = {2023}
}
备注
Accepted at NLPCC 2023 (Oral Presentation)