中文

PTM-VQA:利用野外多样化预训练模型进行视频质量评估

计算机视觉与模式识别 2024-05-29 v1

摘要

视频质量评估(VQA)是一项具有挑战性的任务,由于诸多因素可能影响视频的感知质量,如内容吸引力、失真类型、运动模式及其水平。然而,为视频标注平均意见分数(MOS)需要大量时间和成本,这限制了VQA数据集的规模,并对深度学习方法构成重大障碍。本文提出一种VQA方法,称为PTM-VQA,利用预训练模型(PreTrained Models)从不同预任务中转移知识,以实现多方位的VQA收益。具体而言,我们从不同预训练模型中提取视频特征(保持冻结权重),并将其集成以生成表示。由于这些模型拥有不同领域的知识且通常使用与质量无关的标签进行训练,我们提出了一种基于样本标注的内在一致性与Inter-Divisibility(ICID)损失,以约束来自多个预训练模型提取的特征。其中,内在一致性约束确保不同预训练模型提取的特征位于统一的质量感知潜在空间内,而Inter-Divisibility引入伪聚类,试图分离来自不同聚类的样本特征。此外,随着预训练模型数量的不断增长,确定应使用哪些模型以及如何使用它们至关重要。为此,我们提出一种高效方案来筛选合适的候选模型。选取在VQA数据集上表现更好的聚类性能的模型作为候选。大量实验表明,所提方法有效。

关键词

引用

@article{arxiv.2405.17765,
  title  = {PTM-VQA: Efficient Video Quality Assessment Leveraging Diverse PreTrained Models from the Wild},
  author = {Kun Yuan and Hongbo Liu and Mading Li and Muyi Sun and Ming Sun and Jiachao Gong and Jinhua Hao and Chao Zhou and Yansong Tang},
  journal= {arXiv preprint arXiv:2405.17765},
  year   = {2024}
}

备注

CVPR 2024, 11 pages, 4 figures, 7 tables