黑盒概念学习模型的承诺与陷阱
机器学习
2021-06-28 v1 人工智能
摘要
将概念学习作为决策过程中间步骤的机器学习模型,能够在保持以人类可理解术语解释结果的能力的同时,匹配黑盒预测模型的性能。然而,我们证明这些模型学到的概念表示编码了超出预定义概念的信息,且自然的缓解策略并不能完全奏效,使得对下游预测的解释具有误导性。我们描述了信息泄漏背后的机制,并建议了减轻其影响的补救办法。
引用
@article{arxiv.2106.13314,
title = {Promises and Pitfalls of Black-Box Concept Learning Models},
author = {Anita Mahinpei and Justin Clark and Isaac Lage and Finale Doshi-Velez and Weiwei Pan},
journal= {arXiv preprint arXiv:2106.13314},
year = {2021}
}