面向企业应用的大型语言模型鲁棒性评估:跨格式和跨语言的扰动一致性基准
机器学习
2026-01-13 v1 人工智能
软件工程
摘要
企业级大型语言模型应用需要在多样化场景下保持高质量和可靠性能,对微小扰动具备鲁棒性。现有研究表明,即使存在小幅 prompt 修改,也会导致输出产生显著差异,但主要聚焦于狭窄的扰动集合并使用小规模学术数据集,限制了其对现实场景的适用性。为此,我们提出了一套全面基准测试套件,用于评估跨多种扰动类型的鲁棒性,包括通用文本编辑(如标点、空白)、格式变更(如 JSON、YAML)、多语言和跨语言输入,以及指令位置变更。我们评估了 11 个参数规模从 4B 到 120B+ 的模型,发现微小扰动可使关键企业指标性能下降最高可达 40 个百分点。关键在于,我们证明了模型规模与鲁棒性之间的关系比常规假设更为复杂:8B 参数模型 (Ministral 3 8B) 超越了大多数更大模型,而另一个 8B 参数模型 (Llama 3.1 8B) 则在整体上表现最差。
引用
@article{arxiv.2601.06341,
title = {Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages},
author = {Tara Bogavelli and Oluwanifemi Bamgbose and Gabrielle Gauthier Melançon and Fanny Riols and Roshnee Sharma},
journal= {arXiv preprint arXiv:2601.06341},
year = {2026}
}