ObfusQAte:一种评估大语言模型在混淆事实问答中鲁棒性的框架
计算与语言
2026-03-05 v2 人工智能
机器学习
摘要
大语言模型(LLMs)的快速普及极大地促进了能够进行事实问答(QA)的公平人工智能系统的发展。然而,目前尚无已知研究测试LLMs在面对问题的混淆版本时的鲁棒性。为了系统性地评估这些局限性,我们提出了一种新技术ObfusQAte,并基于此引入了ObfusQA——一个全面的、首创的、具有多层混淆级别的框架,旨在从三个不同维度考察LLM的能力:(i)命名实体间接指代,(ii)干扰项间接指代,以及(iii)上下文过载。通过捕捉语言中这些细粒度的差异,ObfusQA为评估LLM的鲁棒性和适应性提供了一个全面的基准。我们的研究发现,当面对这些日益细微的变体时,LLMs倾向于失败或产生幻觉响应。为了促进这一方向的研究,我们将ObfusQAte公开。
引用
@article{arxiv.2508.07321,
title = {ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering},
author = {Shubhra Ghosh and Abhilekh Borah and Aditya Kumar Guru and Kripabandhu Ghosh},
journal= {arXiv preprint arXiv:2508.07321},
year = {2026}
}
备注
LREC 2026