通过交互式注意力对齐实现人类与深度神经网络视线一致
人工智能
2022-02-08 v1 人机交互
摘要
尽管深度神经网络(DNNs)凭借其强大的自动化能力在几乎所有领域带来重大创新,我们也正目睹自动化背后诸如自动化种族主义、性别偏见和对抗偏见等偏见的危害。随着DNNs的社会影响日益增长,寻找有效方法引导DNNs使其行为与人类心智模型对齐,已成为实现公平且可问责模型不可或缺的一环。我们提出一种新颖的交互式注意力对齐(IAA)框架,旨在实现人类可操控的深度神经网络(DNNs)。IAA利用DNN模型解释方法作为人类可使用的交互媒介,以揭示有偏模型注意力的案例并直接调整注意力。在利用人类生成的调整注意力改进DNN时,我们引入GRADIA,一种联合最大化注意力质量与预测准确性的新颖计算流程。我们在性别分类问题中于研究1评估IAA框架、于研究2评估GRADIA。研究1发现应用IAA能显著提升人类视角下模型注意力的感知质量。在研究2中,我们发现使用GRADIA能够(1)显著提升模型注意力的感知质量,且(2)在训练样本有限的场景下显著提升模型性能。我们给出了面向人类可对齐AI的未来交互式用户界面设计启示。
引用
@article{arxiv.2202.02838,
title = {Aligning Eyes between Humans and Deep Neural Network through Interactive Attention Alignment},
author = {Yuyang Gao and Tong Sun and Liang Zhao and Sungsoo Hong},
journal= {arXiv preprint arXiv:2202.02838},
year = {2022}
}