UNQA: 统一无参考音频、图像、视频及音视频内容质量评估
图像与视频处理
2024-07-30 v1 多媒体
声音
音频与语音处理
摘要
随着互联网上多媒体数据的快速增长, 多媒体数据质量评估 (QA) 变得至关重要, 以满足数字媒体应用的需求。由于多媒体数据包含包括音频、图像、视频及音视频 (A/V) 内容在内的多种模态, 研究人员开发了各种 QA 方法来评估不同模态数据的质量。虽然这些方法专注于解决单一模态的 QA 问题, 但尚缺乏一种能够跨多种模态处理多样化媒体的统一 QA 模型, 而后者更能模拟人类感知行为, 并具备更广泛的应用前景。本文提出了一种统一无参考质量评估模型 (UNQA), 用于音频、图像、视频及 A/V 内容, 旨在在不同媒体模态之间训练单个 QA 模型。为解决不同 QA 数据库中质量尺度不一致的问题, 我们开发了多模态策略, 在多个 QA 数据库上联合训练 UNQA。根据输入模态, UNQA 有选择地提取空间特征、运动特征和音频特征, 并通过四个相应的模态回归模块计算最终质量分数。与现有 QA 方法相比, UNQA 有两大优势: 1) 多模态训练策略使 QA 模型能够学习更通用和稳健的质量感知特征表示, 这一优势体现在 UNQA 在质量评估方面优于现有 SOTA 方法; 2) UNQA 减少了评估跨模态多媒体数据所需的模型数量, 更适合部署到实际应用中。
引用
@article{arxiv.2407.19704,
title = {UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content},
author = {Yuqin Cao and Xiongkuo Min and Yixuan Gao and Wei Sun and Weisi Lin and Guangtao Zhai},
journal= {arXiv preprint arXiv:2407.19704},
year = {2024}
}