AutoODD:基于贝叶斯红队演示的智能体审计
机器人学
2025-09-11 v1
摘要
不论其架构和训练方式,专用机器学习模型都容易在部署时出现故障。随着这些模型在高风险场景中的应用增多,确定其操作设计域(ODD)以确保安全合规的能力变得至关重要。然而,由于高维输入空间的因素,这一过程往往需要大量的人力资源和专业知识。为缓解这一问题,我们引入了 \coolname,这是一个以大语言模型智能体为核心的框架,用于自动生成语义相关的测试用例,以搜索专用黑箱模型中的故障模式。通过将大语言模型智能体作为工具编排者,我们旨在在学习得到的文本嵌入流形上拟合一个具有不确定性的故障分布模型,通过将高维输入空间投影到低维文本嵌入潜空间。该智能体被赋予迭代构建故障景观的任务,利用工具生成测试用例来探测正在测试的模型(MUT)并记录其响应。该智能体还利用工具探测低维流形上的不确定性估计,以引导搜索。我们在使用在 MNIST 数据集上训练的缺失数字模型的一个简单案例中展示了这一过程,并在针对航空器视觉入侵检测的实际场景中进行了实验。
引用
@article{arxiv.2509.08638,
title = {AutoODD: Agentic Audits via Bayesian Red Teaming in Black-Box Models},
author = {Rebecca Martin and Jay Patrikar and Sebastian Scherer},
journal= {arXiv preprint arXiv:2509.08638},
year = {2025}
}