English

Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention

Audio and Speech Processing 2026-01-23 v2 Multimedia Image and Video Processing

Abstract

We introduce a novel deep learning-based audio-visual quality (AVQ) prediction model that leverages internal features from state-of-the-art unimodal predictors. Unlike prior approaches that rely on simple fusion strategies, our model employs a hybrid representation that combines learned Generative Machine Listener (GML) audio features with hand-crafted Video Multimethod Assessment Fusion (VMAF) video features. Attention mechanisms capture cross-modal interactions and intra-modal relationships, yielding context-aware quality representations. A modality relevance estimator quantifies each modality's contribution per content, potentially enabling adaptive bitrate allocation. Experiments demonstrate improved AVQ prediction accuracy and robustness across diverse content types.

Keywords

Cite

@article{arxiv.2509.16994,
  title  = {Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention},
  author = {Ina Salaj and Arijit Biswas},
  journal= {arXiv preprint arXiv:2509.16994},
  year   = {2026}
}

Comments

Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026