中文

ObfusQAte:一种评估大语言模型在混淆事实问答中鲁棒性的框架

计算与语言 2026-03-05 v2 人工智能 机器学习

摘要

大语言模型(LLMs)的快速普及极大地促进了能够进行事实问答(QA)的公平人工智能系统的发展。然而,目前尚无已知研究测试LLMs在面对问题的混淆版本时的鲁棒性。为了系统性地评估这些局限性,我们提出了一种新技术ObfusQAte,并基于此引入了ObfusQA——一个全面的、首创的、具有多层混淆级别的框架,旨在从三个不同维度考察LLM的能力:(i)命名实体间接指代,(ii)干扰项间接指代,以及(iii)上下文过载。通过捕捉语言中这些细粒度的差异,ObfusQA为评估LLM的鲁棒性和适应性提供了一个全面的基准。我们的研究发现,当面对这些日益细微的变体时,LLMs倾向于失败或产生幻觉响应。为了促进这一方向的研究,我们将ObfusQAte公开。

关键词

引用

@article{arxiv.2508.07321,
  title  = {ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering},
  author = {Shubhra Ghosh and Abhilekh Borah and Aditya Kumar Guru and Kripabandhu Ghosh},
  journal= {arXiv preprint arXiv:2508.07321},
  year   = {2026}
}

备注

LREC 2026