中文

用于联合人类-机器视觉的所有场景图像编码:多路径聚合

计算机视觉与模式识别 2024-10-01 v1 图像与视频处理

摘要

针对多任务应用进行图像编码,满足人类感知和机器视觉的需求,已受到广泛关注。现有方法通常依赖于多个任务特定的编码器-解码器对,导致参数和比特率使用开销高,或在统一表示下面临多目标优化挑战,难以实现性能和效率的平衡。为此,我们提出将多路径聚合 (MPA) 集成到现有编码模型中,用于联合人类-机器视觉,统一特征表示。MPA 采用预测器根据特征在不同任务中的重要性不同,将潜在特征分配给任务特定路径,以最大化共享特征的实用性,同时保留任务特定特征用于后续细化。利用特征相关性,我们开发了两阶段优化策略以缓解多任务性能下降。在共享特征重用的基础上,仅需 1.89% 的参数即可进一步增强和微调以适应特定任务,完全避免了对整个模型进行大规模优化。实验结果表明,MPA 在人类观看和机器分析任务中的任务特定和多目标优化方面,性能相当于最先进的方法。此外,我们的全场景设计支持在人类和机器导向的重建之间无缝转换,实现任务可控的解释,而无需更改统一模型。代码可在 https://github.com/NJUVISION/MPA 获取。

关键词

引用

@article{arxiv.2409.19660,
  title  = {All-in-One Image Coding for Joint Human-Machine Vision with Multi-Path Aggregation},
  author = {Xu Zhang and Peiyao Guo and Ming Lu and Zhan Ma},
  journal= {arXiv preprint arXiv:2409.19660},
  year   = {2024}
}

备注

NeurIPS 2024