支持人机协作以 LLM 审计 LLM
人机交互
2023-12-01 v3 人工智能
计算与语言
摘要
大型语言模型正通过在社会技术系统中的部署而日益渗透并遍布社会。然而,这些语言模型无论是用于分类还是生成,都已被证明存在偏见且行为不负责任,从而大规模地对人造成伤害。严格审计这些语言模型至关重要。现有的审计工具利用人类和/或 AI 来发现故障。在本工作中,我们借鉴人机协作与意义建构方面的文献,并对安全与公平 AI 领域的研究专家进行访谈,以在由生成式大型语言模型(LLM)驱动的审计工具 AdaTest(Ribeiro and Lundberg, 2022)基础上进行构建。通过设计过程,我们强调了意义建构与人机沟通的重要性,以在协作审计中利用人类与生成式模型的互补优势。为评估增强工具 AdaTest++ 的有效性,我们对审计两个商业语言模型的参与者进行了用户研究:OpenAI 的 GPT-3 和 Azure 的情感分析模型。定性分析表明,AdaTest++ 有效利用了人类在图式化、假设形成与检验等方面的优势。此外,借助我们的工具,参与者识别了多种故障模式,覆盖 2 项任务中 26 个不同主题,这些模式既包含既往正式审计中已发现的,也包含此前未被充分报告的。
引用
@article{arxiv.2304.09991,
title = {Supporting Human-AI Collaboration in Auditing LLMs with LLMs},
author = {Charvi Rastogi and Marco Tulio Ribeiro and Nicholas King and Harsha Nori and Saleema Amershi},
journal= {arXiv preprint arXiv:2304.09991},
year = {2023}
}
备注
21 pages, 3 figures