中文

DT-JRD:面向机器视频编码的基于深度 Transformer 的恰可识别差异预测模型

图像与视频处理 2024-11-15 v1 计算机视觉与模式识别

摘要

恰可识别差异(JRD)表示机器视觉可检测到的最小视觉差异,可被利用以促进面向机器视觉的视觉信号处理。在本文中,我们提出了一种面向机器视频编码(VCM)的基于深度 Transformer 的 JRD(DT-JRD)预测模型,其中准确预测的 JRD 可用于在保持机器任务准确率的同时降低编码比特率。首先,我们将 JRD 预测建模为多类分类,并提出了一种 DT-JRD 预测模型,该模型集成了改进的嵌入、内容与失真特征提取、多类分类以及一种新颖的学习策略。其次,受机器视觉在 JRD 附近对失真表现出相似响应的感知特性的启发,我们提出了一种使用基于高斯分布的软标签(GDSL)的渐近 JRD 损失,这显著扩展了训练标签的数量并放宽了分类边界。最后,我们提出了一种基于 DT-JRD 的 VCM,以在保持目标检测准确率的同时减少编码比特。大量实验结果表明,DT-JRD 预测的 JRD 的平均绝对误差为 5.574,比最先进的 JRD 预测模型提高了 13.1%。编码实验表明,与 VVC 相比,基于 DT-JRD 的 VCM 在保持目标检测准确率的同时,平均实现了 29.58% 的比特率降低。

关键词

引用

@article{arxiv.2411.09308,
  title  = {DT-JRD: Deep Transformer based Just Recognizable Difference Prediction Model for Video Coding for Machines},
  author = {Junqi Liu and Yun Zhang and Xiaoqi Wang and Xu Long and Sam Kwong},
  journal= {arXiv preprint arXiv:2411.09308},
  year   = {2024}
}

备注

Submitted to IEEE Transactions on Multimedia