中文

LLMAuditor:一种利用人机回环审计大型语言模型的框架

人工智能 2024-05-24 v3

摘要

随着大型语言模型(LLM)在各种用户和场景中日益普及,识别使用这些模型时的潜在问题变得至关重要。此类问题的示例包括:偏见、不一致性和幻觉。虽然对 LLM 进行此类问题的审计通常是必要的,但该过程对大多数人而言既不容易也不易获得。一种有效的方法是使用同一问题的不同版本来探测 LLM。这可以暴露其知识或操作中的不一致性,表明存在偏见或幻觉的潜在可能。然而,要将这种审计方法规模化运作,我们需要一种可靠且自动化的方法来创建这些探测问题。在本文中,我们提出了 LLMAuditor 框架,这是一种自动化的可扩展解决方案,其中使用另一个 LLM 结合人机回环(HIL)。该方法提供了可验证性和透明度,同时避免了对同一 LLM 的循环依赖,并提高了科学严谨性和泛化能力。具体而言,LLMAuditor 包括两个阶段的人工验证:用于验证响应的标准化评估标准,以及用于生成所需探测问题的结构化提示模板。一项使用 TruthfulQA 数据集中问题的案例研究表明,我们可以从一个 LLM 生成一组可靠的探测问题,用于审计另一个 LLM 中的不一致性。我们的结构化提示模板结合 HIL 增强了这一过程,不仅提高了我们审计方法的可靠性,还产生了幻觉更少的结果。我们研究的新颖性源于开发了一个全面的通用框架,该框架包含用于审计 LLM 生成响应的经 HIL 验证的提示模板。

关键词

引用

@article{arxiv.2402.09346,
  title  = {LLMAuditor: A Framework for Auditing Large Language Models Using Human-in-the-Loop},
  author = {Maryam Amirizaniani and Jihan Yao and Adrian Lavergne and Elizabeth Snell Okada and Aman Chadha and Tanya Roosta and Chirag Shah},
  journal= {arXiv preprint arXiv:2402.09346},
  year   = {2024}
}