基于内容自适应的运动对齐框架用于学习视频压缩
计算机视觉与模式识别
2025-12-16 v1 人工智能
信息检索
摘要
近期端到端视频压缩技术的进展显示出广泛的应用前景,由于统一的端到端学习优化。然而,这类通用框架往往缺乏内容特定的适应,导致压缩性能次优。为此,本文提出了基于内容自适应的运动对齐框架,通过针对不同内容特征调整编码策略来提高性能。具体而言,我们首先引入两阶段基于流的可变形扭曲机制,以粗到细偏移预测和掩码调制来细化运动补偿,实现精确的特征对齐。其次,我们提出了多参考质量感知策略,根据参考质量调整失真权重,并应用于分层训练以减少误差传播。最后,我们集成一个无训练模块,通过运动幅度和分辨率对帧进行下采样,以获得平滑的运动估计。在标准测试数据集上的实验结果表明,我们的框架CAMA相对于最先进的神经视频压缩模型具有显著改进,相对于基线模型DCVC-TCM实现了24.95%的BD率(PSNR)节省,同时也优于再现的DCVC-DC和传统编解码器HM-16.25。
引用
@article{arxiv.2512.12935,
title = {Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion},
author = {Toan Le Ngo Thanh and Phat Ha Huu and Tan Nguyen Dang Duy and Thong Nguyen Le Minh and Anh Nguyen Nhu Tinh},
journal= {arXiv preprint arXiv:2512.12935},
year = {2025}
}
备注
Accepted at AAAI Workshop 2026