超越MOS的建模:质量评估模型必须融合上下文、推理与多模态
计算机视觉与模式识别
2025-05-27 v1 多媒体
图像与视频处理
摘要
这篇立场论文指出,平均主观评分(MOS)虽然在历史上具有基础性地位,但已不足以作为多媒体质量评估模型的唯一监督信号。MOS将丰富且依赖上下文的人类判断简化为单一标量,掩盖了语义失败、用户意图以及质量决策背后的依据。我们认为,现代质量评估模型必须融合三种相互依赖的能力:(1)上下文感知,以使评估适应特定任务目标和观看条件;(2)推理,以对质量判断产生可解释的、基于证据的论证;(3)多模态,以利用视觉语言模型对齐感知与语义线索。我们批判了当前以MOS为中心的基准的局限性,并提出了改革路线图:构建包含上下文元数据和专家依据的更丰富的数据集,以及评估语义对齐、推理保真度和上下文敏感性的新指标。通过将质量评估重新定义为上下文相关、可解释且多模态的建模任务,我们旨在推动向更鲁棒、更符合人类意图且更值得信赖的评估系统的转变。
引用
@article{arxiv.2505.19696,
title = {Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality},
author = {Mohamed Amine Kerkouri and Marouane Tliba and Aladine Chetouani and Nour Aburaed and Alessandro Bruno},
journal= {arXiv preprint arXiv:2505.19696},
year = {2025}
}
备注
Under review