中文

面向图像复杂度评估的跨模态场景语义对齐

计算机视觉与模式识别 2025-10-22 v1

摘要

图像复杂度评估 (ICA) 是感知评估中的一个具有挑战性的任务,due to 人类感知的主观性质以及现实图像中固有的语义多样性。现有的 ICA 方法主要依赖单一视觉模态的手工特征或浅层卷积神经网络特征,这些特征不足以充分捕获与图像复杂度密切相关的感知表征。最近的研究表明,跨模态场景语义信息在各种计算机视觉任务中发挥着关键作用,尤其是涉及感知理解的任务中。然而,在 ICA 语境中探索跨模态场景语义信息尚未被 addresses。因此,本 paper 提出了一种 novel ICA 方法,称为 Cross-Modal Scene Semantic Alignment (CM-SSA),该方法利用跨模态视角的场景语义对齐来提高 ICA 性能,使复杂度预测更符合主观人类感知。具体而言,所提出的 CM-SSA 包括一个复杂度回归分支和一个场景语义对齐分支。复杂度回归分支在场景语义对齐分支的指导下估计图像复杂度水平,而场景语义对齐分支用于通过 pair-wise 学习将图像与传递丰富场景语义信息的文本提示对齐。广泛的实验表明,所提出的 CM-SSA 在多个 ICA 数据集上显著优于 state-of-the-art 方法。代码已公开于 https://github.com/XQ2K/First-Cross-Model-ICA。

关键词

引用

@article{arxiv.2510.18377,
  title  = {Cross-Modal Scene Semantic Alignment for Image Complexity Assessment},
  author = {Yuqing Luo and Yixiao Li and Jiang Liu and Jun Fu and Hadi Amirpour and Guanghui Yue and Baoquan Zhao and Padraig Corcoran and Hantao Liu and Wei Zhou},
  journal= {arXiv preprint arXiv:2510.18377},
  year   = {2025}
}

备注

14 pages,2 figures, British Machine Vision Conference