TCNL:通过嵌入人类引导概念实现透明可控的网络学习
机器学习
2022-11-24 v3 人工智能
摘要
解释深度学习模型对于理解人工智能系统、提升安全性和评估公平性至关重要。为更好地理解并控制CNN模型,已有许多关于透明性-可解释性的方法被提出。然而,这些工作大多对人类而言不够直观,且对CNN模型的人类控制力不足。我们提出一种新方法——透明可控网络学习(TCNL),以克服上述挑战。为提升透明性-可解释性,TCNL中通过科学的人类直觉研究为特定分类任务定义若干概念,并将概念信息融入CNN模型。TCNL中,浅层特征提取器首先获取初步特征;随后在浅层特征提取器之后构建若干概念特征提取器,以学习高维概念表示。概念特征提取器被鼓励编码与预定义概念相关的信息。我们还构建了概念映射器,以人类直观的方式可视化概念提取器提取的特征。TCNL为透明性-可解释性提供了一种可泛化的方法。研究者可定义对应于特定分类任务的概念,并鼓励模型编码特定概念信息,这在一定程度上提升了CNN模型的透明性-可解释性与可控性。我们实验所用的数据集(含概念集)也将发布(https://github.com/bupt-ai-cz/TCNL)。
引用
@article{arxiv.2210.03274,
title = {TCNL: Transparent and Controllable Network Learning Via Embedding Human-Guided Concepts},
author = {Zhihao Wang and Chuang Zhu},
journal= {arXiv preprint arXiv:2210.03274},
year = {2022}
}