English

Semantic Video Communication via Multi-Scale Convolution and Dynamic Routing for Next-Generation Networks

Computer Vision and Pattern Recognition 2026-07-06 v1

Abstract

The exponential growth of video traffic demands novel semantic communication paradigms that transmit meaning rather than raw bits. We present a generative AI-enabled framework for semantic video communication addressing two critical challenges: efficient hierarchical temporal modeling for bandwidth-constrained transmission and robust semantic alignment between video content and natural language queries at network edge devices. Our approach introduces a multi-scale temporal convolutional encoder that captures motion patterns across different temporal granularities with O(T) complexity suitable for resource-constrained IoT deployments. We further propose a capsule-based dynamic routing mechanism that iteratively refines segment-query associations, enabling flexible modeling of non-monotonic semantic alignments essential for goal-oriented communication. These components are unified through a multi-task learning objective optimizing temporal boundary regression, cross-modal alignment, and capsule diversity. Experiments on ActivityNet Captions demonstrate significant improvements, achieving 42.9% [email protected] and 41.1% mean IoU while maintaining computational efficiency critical for edge deployment.

Cite

@article{arxiv.2607.05093,
  title  = {Semantic Video Communication via Multi-Scale Convolution and Dynamic Routing for Next-Generation Networks},
  author = {Gengtian Shi and Jinze Yu and Chenhao Wu and Shaofei Wang and Eiji Fukuzawa and Junjie Tang and Hiroshi Onoda and Jiang Liu},
  journal= {arXiv preprint arXiv:2607.05093},
  year   = {2026}
}

Comments

Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)