中文

AuditLLM:使用多探针方法审计大型语言模型的工具

人工智能 2024-06-19 v2

摘要

随着大型语言模型(LLM)被集成到各个领域,确保其可靠性和安全性至关重要。这需要严格的探测和审计,以维持其在实际应用中的有效性和可信度。对LLM进行单个查询的多次迭代可以揭示其知识库或功能能力中的潜在不一致性。然而,目前缺乏一种能够以易于执行的工作流程和低技术门槛执行此类审计的工具。在此演示中,我们介绍了“AuditLLM”,一种旨在以系统化方式审计各种LLM性能的新型工具。AuditLLM的主要功能是通过部署从单个问题派生的多个探针来审计给定的LLM,从而检测模型理解或性能中的任何不一致性。一个稳健、可靠且一致的LLM应该对同一问题的不同措辞版本生成语义相似的响应。基于这一前提,AuditLLM生成易于解释的结果,这些结果基于用户提供的单个输入问题反映LLM的一致性。已证明一定程度的不一致性是潜在偏见、幻觉和其他问题的指标。然后,人们可以使用AuditLLM的输出进一步调查上述LLM的问题。为了便于演示和实际使用,AuditLLM提供两种关键模式:(1)实时模式,通过分析对实时查询的响应来即时审计LLM;(2)批量模式,通过一次处理多个查询进行深入分析,促进全面的LLM审计。该工具对研究人员和普通用户都有益,因为它使用标准化的审计平台增强了我们对LLM生成响应能力的理解。

关键词

引用

@article{arxiv.2402.09334,
  title  = {AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach},
  author = {Maryam Amirizaniani and Elias Martin and Tanya Roosta and Aman Chadha and Chirag Shah},
  journal= {arXiv preprint arXiv:2402.09334},
  year   = {2024}
}