基于时空注意力的语义压缩用于实时视频识别
计算机视觉与模式识别
2023-05-23 v1 网络与互联网体系结构
摘要
本文研究边缘计算中视频动作识别的计算卸载。为实现有效的语义信息提取与压缩,遵循语义通信我们提出了一种新颖的基于时空注意力的自编码器(STAE)架构,包括帧注意力模块与空间注意力模块,以评估各帧中帧与像素的重要性。此外,我们使用熵编码消除压缩数据中的统计冗余,以进一步降低通信开销。在接收端,我们开发了轻量解码器,利用 3D-2D CNN 组合架构从接收数据同时学习时间与空间信息以重建缺失信息,从而提高精度。为加速收敛,我们采用逐步方法训练所得的基于 STAE 的视觉 Transformer(ViT_STAE)模型。实验结果表明,ViT_STAE 可将视频数据集 HMDB51 压缩 104 倍且仅损失 5% 精度,优于当前最优基线 DeepISC。所提 ViT_STAE 在时变无线信道下比基于 DeepISC 的 ViT 模型推理更快且精度更高,这凸显了 STAE 在时间约束下保证更高精度的有效性。
引用
@article{arxiv.2305.12796,
title = {Spatiotemporal Attention-based Semantic Compression for Real-time Video Recognition},
author = {Nan Li and Mehdi Bennis and Alexandros Iosifidis and Qi Zhang},
journal= {arXiv preprint arXiv:2305.12796},
year = {2023}
}
备注
Submitted to IEEE Globecom 2023