BiasAsker:面向对话式 AI 系统偏见的度量框架
计算与语言
2023-05-23 v1 人工智能
摘要
借助先进的人工智能(AI)技术,诸如 ChatGPT 以及 Siri 等数字助手之类的对话式 AI 系统已在日常生活中广泛部署。然而,此类系统仍可能产生包含偏见与刻板印象的内容,引发潜在的社会问题。由于现代 AI 技术的数据驱动、黑盒特性,全面识别并度量对话系统中的偏见仍是一项挑战性任务。特别是,由于缺乏同时包含社会群体与偏见属性的数据,难以生成能够全面触发潜在偏见的输入。此外,现代对话系统可产生多样化回复(如闲聊与解释),这使得现有仅基于情感与毒性的偏见检测方法难以适用。本文提出 BiasAsker,一种用于识别并度量对话式 AI 系统中社会偏见的自动化框架。为获取社会群体与偏见属性,我们构建了一个全面的社会偏见数据集,共包含 841 个群体与 8,110 个偏见属性。基于该数据集,BiasAsker 自动生成问题,并采用一种基于存在性度量的新方法,识别对话系统中的两类偏见(即绝对偏见与相关偏见)。在 8 个商业系统与 2 个知名研究模型(如 ChatGPT 与 GPT-3)上的大量实验表明,BiasAsker 生成的问题中有 32.83% 可触发这些广泛部署的对话系统中的偏见行为。所有代码、数据与实验结果均已公开,以促进未来研究。
引用
@article{arxiv.2305.12434,
title = {BiasAsker: Measuring the Bias in Conversational AI System},
author = {Yuxuan Wan and Wenxuan Wang and Pinjia He and Jiazhen Gu and Haonan Bai and Michael Lyu},
journal= {arXiv preprint arXiv:2305.12434},
year = {2023}
}
备注
Accepted by FSE 2023