中文

搭建认知鸿沟:用于艺术图像审美评估的层次化描述学习

计算机视觉与模式识别 2026-01-06 v2

摘要

审美质量评估任务是开发人类对齐的定性AIGC评估系统的关键任务,但其内在的复杂性——横跨视觉感知、认知与情感——构成了根本性挑战。虽然审美描述提供了可行的表示方式,但仍存在两个关键挑战:(1)数据稀缺与不平衡:现有数据集过度关注视觉感知,忽略了因人工标注成本高昂而导致的深层维度;(2)模型碎片化:当前视觉网络通过多分支编码器孤立处理审美属性,而以对比学习为代表的多模态方法难以有效处理长篇文本描述。为解决挑战(1),本文首先提出精炼审美描述(Refined Aesthetic Description,RAD)数据集,一个大规模(7万)多维结构数据集,通过无需高额标注成本且易于扩展的迭代流程生成。为解决挑战(2),本文提出ArtQuant,一种用于艺术图像审美评估的框架,不仅将孤立的审美维度通过联合描述生成进行耦合,还通过LLM解码器更好地建模长文本语义。除此之外,理论分析确认了这种共生关系:RAD的语义充分性(数据)与生成范式(模型)共同最小化预测熵,为该框架提供了数学依据。我们的方法在多个数据集上实现了最佳性能,仅需常规训练 epochs 的33%,显著缩小了艺术图像与审美判断之间的认知鸿沟。我们将公开代码与数据集以支持未来研究。

关键词

引用

@article{arxiv.2512.23413,
  title  = {Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment},
  author = {Henglin Liu and Nisha Huang and Chang Liu and Jiangpeng Yan and Huijuan Huang and Jixuan Ying and Tong-Yee Lee and Pengfei Wan and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2512.23413},
  year   = {2026}
}

备注

AAAI2026,Project Page:https://github.com/Henglin-Liu/ArtQuant