注意力式AV-FusionNet:基于混合注意力的音视频质量预测
音频与语音处理
2026-01-23 v2 多媒体
图像与视频处理
摘要
我们引入一种新型深度学习基于音视频质量(AVQ)预测模型,利用来自领先单模态预测器的内部特征。不同于以往依赖简单融合策略的方法,本模型采用混合表示,结合所学习的生成式机器听者(GML)音频特征与手工制作的视频多方法评估融合(VMAF)视频特征。注意力机制捕获跨模态互动和模内关系,产生情境感知的质量表征。一种模态相关性估计器量化每种模态对特定内容的贡献,可为自适应比特率分配提供依据。实验表明,该方法在多样化内容类型上的AVQ预测精度和鲁棒性得到提升。
引用
@article{arxiv.2509.16994,
title = {Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention},
author = {Ina Salaj and Arijit Biswas},
journal= {arXiv preprint arXiv:2509.16994},
year = {2026}
}
备注
Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026