Shared Interest:度量人机对齐以识别模型行为中的反复模式
机器学习
2022-03-28 v2
摘要
显著性方法——识别输入特征对模型输出重要性的技术——是理解神经网络行为的常见步骤。然而,解释显著性需要繁琐的手动检查以识别并聚合模型行为中的模式,导致临时性或挑拣式的分析。为解决这些问题,我们提出 Shared Interest:用于将模型推理(通过显著性)与人类推理(通过真值标注)进行比较的度量。通过提供定量描述符,Shared Interest 支持对输入进行排序、分类和聚合,从而促进对模型行为的大规模系统性分析。我们使用 Shared Interest 识别了模型行为中的八种反复模式,例如上下文特征或真值特征的某个子集对模型最为重要的情形。与具有代表性的真实用户合作,我们展示了如何使用 Shared Interest 来判断模型是否可信、发现手动分析中遗漏的问题,并实现交互式探查。
引用
@article{arxiv.2107.09234,
title = {Shared Interest: Measuring Human-AI Alignment to Identify Recurring Patterns in Model Behavior},
author = {Angie Boggust and Benjamin Hoover and Arvind Satyanarayan and Hendrik Strobelt},
journal= {arXiv preprint arXiv:2107.09234},
year = {2022}
}
备注
17 pages, 10 figures. Published in CHI 2022. For more details, see http://shared-interest.csail.mit.edu