解构准确性-可解释性权衡:基于评论推断评分的案例研究
人工智能
2025-03-12 v1 计算与语言
机器学习
摘要
可解释机器学习模型虽然提供可理解的推理过程,但并不总能匹配其黑箱对手的性能。在准确性与模型可解释性之间存在权衡,这引发了关于 AI 在关键应用领域部署的讨论,尤其是当决策背后的原因对信任和问责制至关重要时。本研究聚焦于比较分析多个黑箱与可解释模型,重点关注一个受限关注的 NLP 用例:从评论中推断评分。通过这一用例,我们探讨了不同模型在性能与可解释性之间的复杂关系。我们引入一种称为复合可解释性(Composite Interpretability, CI) 的量化分数,以帮助可视化可解释性与性能之间的权衡,尤其是在复合模型中。我们的结果表明,一般而言,学习性能随可解释性下降而提升,但这种关系并非严格单调,且存在可解释模型更具优势的情形。
引用
@article{arxiv.2503.07914,
title = {Demystifying the Accuracy-Interpretability Trade-Off: A Case Study of Inferring Ratings from Reviews},
author = {Pranjal Atrey and Michael P. Brundage and Min Wu and Sanghamitra Dutta},
journal= {arXiv preprint arXiv:2503.07914},
year = {2025}
}
备注
Accepted at DAI Workshop, AAAI-2025