中文

单模型双心:基于任务条件的统一图像质量与美学评估

计算机视觉与模式识别 2026-03-23 v1

摘要

将图像质量评估 (IQA) 和图像美学评估 (IAA) 统一到单一的多模态大语言模型中具有吸引力,但现有方法采用任务中立的配方,对两项任务都应用相同的推理策略和奖励。我们指出这根本上是误配的:IQA 依赖于低层次、客观的感知线索,并受益于简洁的失真导向推理;而 IAA 需要深思熟虑的语义判断,点对分数回归效果不佳。我们将其识别为推理不匹配和优化不匹配,并通过受控探针提供实证证据。受此启发,我们提出 TATAR (Task-Aware Thinking with Asymmetric Rewards),一个统一框架,在每个任务的特性上进行条件化后训练。TATAR 结合三个组件:快速-慢速任务特定推理构建,将 IQA 与简洁的感知论证搭配,将 IAA 与深思熟虑的美学叙事搭配;两阶段 SFT+GRPO 学习,在奖励驱动的细化之前建立任务感知的行为先验;以及针对 IQA 和 IAA 的非对称奖励,分别应用高斯得分塑形和斯图尔特式完成排序。广泛的实验在八个基准上表明,TATAR 在域内和跨域设置下均 consistently 优于先前的统一基线,在两个任务上均表现出竞争力,且在美学评估方面训练动态更稳定。我们的结果确立了任务条件化后训练作为统一感知评分的原则方法。我们的代码可在 https://github.com/yinwen2019/TATAR 上公开获取。

关键词

引用

@article{arxiv.2603.19779,
  title  = {One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment},
  author = {Wen Yin and Cencen Liu and Dingrui Liu and Bing Su and Yuan-Fang Li and Tao He},
  journal= {arXiv preprint arXiv:2603.19779},
  year   = {2026}
}

备注

10 pages,7 figures