中文

DReX:自监督与卷积表征的纯视觉融合用于图像复杂度预测

计算机视觉与模式识别 2025-11-24 v1

摘要

视觉复杂度预测是计算机视觉中的基础问题,具有图像压缩、检索和分类等实际应用。理解人类为何感知某图像为复杂也是认知科学中长期存在的问题。近期方法利用多模态模型结合视觉与语言表征,但语言信息是否对该任务至关重要尚不明确。我们提出 DReX(DINO-ResNet Fusion),一种仅使用视觉特征的模型,通过可学习注意力机制融合自监督与卷积表征,用于预测图像复杂度。该架构将 ResNet-50 的多尺度层次特征与 DINOv3 ViT-S/16 的语义丰富表征相结合,使模型能够捕捉低层次纹理模式和高层次语义结构。DReX 在 IC9600 数据集上实现了最先进的性能(Pearson r = 0.9581),超越了包括在多模态图像-文本数据上训练的模型,所用参数数量仅为其约 21.5 倍。此外,DReX 在多个数据集和指标上均表现出良好的鲁棒性,在 Pearson、Spearman 相关系数、均方根误差(RMSE)和平均绝对误差(MAE)等指标上均取得优异成绩。消融实验和注意力分析确认,DReX 有效利用两个 backbone 的互补线索,DINOv3 [CLS] 标记提升了对视觉复杂度的敏感性。我们的发现表明,仅凭视觉特征即可为人类感知的复杂度预测提供足够的信息,并且,当表征得当融合时,自监督变换器和监督深度卷积神经网络具有互补且协同的优势。

关键词

引用

@article{arxiv.2511.16991,
  title  = {DReX: Pure Vision Fusion of Self-Supervised and Convolutional Representations for Image Complexity Prediction},
  author = {Jonathan Skaza and Parsa Madinei and Ziqi Wen and Miguel Eckstein},
  journal= {arXiv preprint arXiv:2511.16991},
  year   = {2025}
}

备注

8 pages