中文

在扰动观测下对黑盒LLM规划器鲁棒性的特征化:基于自适应应力测试

机器人学 2026-05-13 v4 人工智能 计算与语言

摘要

大型语言模型 (LLM) 近期在规划、控制和预测等决策任务中展现出成功,但其倾向于产生不安全且不希望的输出在风险控制方面构成挑战。这种不良行为在传感器噪声或不可靠的环境中进一步恶化。对LLM规划器对不同观测的响应进行特征化是必要的,以在安全关键场景中主动避免故障。我们特别研究了LLM沿两个不同扰动维度的响应。一个维度生成语义上相似的提示,方法是随机化细节顺序、修改零样本示例等。独特于我们工作的是第二个维度模拟各种传感器和噪声,以模拟原始传感器或检测算法故障。在扰动被手动应用的初始案例研究中,两个维度都导致LLM在多智能体驾驶环境中产生幻觉。然而,手动覆盖多个情景的整个扰动空间是不可行的。因此,我们提出一种新方法,通过自适应应力测试 (AST) 结合蒙特卡洞树搜索 (MCTS) 高效搜索提示扰动空间。我们的AST表述能够发现导致语言模型产生高不确定性甚至崩溃的情景、传感器配置和提示措辞。通过在多样化情景中生成MCTS提示扰动树,我们通过大量实验表明,离线分析可用于主动理解运行时可能出现的潜在故障。代码已公开于 https://sites.google.com/illinois.edu/astllm。

关键词

引用

@article{arxiv.2505.05665,
  title  = {Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing},
  author = {Neeloy Chakraborty and John Pohovey and Melkior Ornik and Katherine Driggs-Campbell},
  journal= {arXiv preprint arXiv:2505.05665},
  year   = {2026}
}

备注

Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables