UniPercept:面向美学、质量、结构与纹理的统一感知级图像理解
计算机视觉与模式识别
2025-12-29 v1
摘要
多模态大语言模型(MLLMs)在视觉 grounding、分割和描述等视觉理解任务中取得了显著进展。然而,其感知级图像特征感知能力仍受限。本文提出 UniPercept-Bench,一个用于跨三个关键领域(美学、质量、结构和纹理)的感知级图像理解统一框架。我们建立了分层定义体系,构建大规模数据集以评估感知级图像理解。基于此基础,我们开发了通过领域自适应预训练和任务对齐强化学习训练的强基线 UniPercept,使其在视觉评估(VR)和视觉问答(VQA)任务中具备鲁棒的泛化能力。UniPercept 在感知级图像理解方面超越现有 MLLMs,可作为文本到图像生成的即插即用奖励模型。本工作定义了 MLLMs 时代的感知级图像理解,并通过引入全面基准和强基线,为推动感知级多模态图像理解奠定了坚实基础。
引用
@article{arxiv.2512.21675,
title = {UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture},
author = {Shuo Cao and Jiayang Li and Xiaohui Li and Yuandong Pu and Kaiwen Zhu and Yuanting Gao and Siqi Luo and Yi Xin and Qi Qin and Yu Zhou and Xiangyu Chen and Wenlong Zhang and Bin Fu and Yu Qiao and Yihao Liu},
journal= {arXiv preprint arXiv:2512.21675},
year = {2025}
}
备注
27 pages, 14 figures, 17 tables