中文

EnTri:基于三级表征集成学习的可解释场景识别

计算机视觉与模式识别 2024-07-16 v2

摘要

基于深度学习的场景识别已取得显著进展,但由于类间相似性与类内差异性带来的挑战,其性能仍存在局限。此外,先前研究主要关注提升分类准确率,却较少关注实现可解释、精确的场分类。因此,我们受此驱动提出 EnTri,一种利用视觉特征层次结构进行集成学习的场景识别集成框架。EnTri 在三个不同细节层级表征特征:像素级、语义分割级以及对象类别与频次级。通过结合不同复杂度的特征编码方案并利用集成策略,我们的方法旨在提升分类准确率,同时通过视觉与文本解释增强透明性与可解释性。为实现可解释性,我们设计了一种扩展算法,生成视觉与文本解释,突出给定场景中对最终类别预测有贡献的多种属性,包括对象、统计信息、空间布局与纹理细节。通过在基准场景分类数据集上的实验,EnTri 在识别准确率上展现出优越性,与最先进方法相比具有竞争力,在 MIT67、SUN397 和 UIUC8 数据集上分别达到 87.69%、75.56% 和 99.17% 的准确率。

关键词

引用

@article{arxiv.2307.12442,
  title  = {EnTri: Ensemble Learning with Tri-level Representations for Explainable Scene Recognition},
  author = {Amirhossein Aminimehr and Amirali Molaei and Erik Cambria},
  journal= {arXiv preprint arXiv:2307.12442},
  year   = {2024}
}