人工心理现象:以心理物理学为框架检测 AI 模型中的感知偏差
计算与语言
2019-12-24 v1 人工智能
计算机与社会
神经与进化计算
摘要
由于深度学习的不可穿透性,检测人工智能中的偏差已变得困难。核心难点在于将模型内部不可观测的现象与可从输入和输出测量的外部可观测量联系起来。例如,我们能否通过使用基于词嵌入系统的问题与答案来检测对职业的性别化感知(如女性图书管理员、男性电工)?当前检测偏差的技术通常针对特定任务、数据集或方法定制,影响了其泛化能力。在这项工作中,我们借鉴实验心理学中的心理物理学——旨在将现实世界中的量(即“物理”)与心智中的主观度量(即“心理”)相关联——提出一个具有智力连贯性与可泛化性的框架,用于检测 AI 中的偏差。具体而言,我们改编了双备选强制选择任务(2AFC)来估计黑盒模型中潜在的偏差及其强度。我们成功复现了词嵌入与情感分析预测中已知的偏差感知。我们讨论了实验心理学中的概念如何自然应用于理解人工心理现象,以及心理物理学如何构成研究 AI 公平性的有用方法论基础。
引用
@article{arxiv.1912.10818,
title = {Artificial mental phenomena: Psychophysics as a framework to detect perception biases in AI models},
author = {Lizhen Liang and Daniel E. Acuna},
journal= {arXiv preprint arXiv:1912.10818},
year = {2019}
}
备注
FAT Conference 2020