对象表示的多尺度融合
计算机视觉与模式识别
2025-11-11 v3
摘要
将图像或视频表示为对象级特征向量,而非像素级特征图,可促进高级视觉任务。对象中心学习(OCL)主要通过重构输入并借助变分自编码器(VAE)中间表示驱动所谓“插槽”聚集尽可能多的对象信息。然而,现有 VAE 指导未显式解决对象在像素尺寸上的变化,而模型通常仅在特定尺度模式上表现良好。我们提出“多尺度融合”(MSF)以增强 OCL 训练中的 VAE 指导。为确保所有尺度的对象落入 VAE 的适应范围,我们采用“图像金字塔”,产生多个尺度的中间表示;为培育对象超像素在尺度不变/变量方面的特性,我们设计“inter-/intra-scale fusion”,将一个尺度的低质量对象超像素增强来自另一个尺度的对应高质量超像素。在标准 OCL 基准上,我们的方法改进了主流方法,包括最新基于扩散的方法。源码已于 https://github.com/Genera1Z/MultiScaleFusion 提供。
引用
@article{arxiv.2410.01539,
title = {Multi-Scale Fusion for Object Representation},
author = {Rongzhen Zhao and Vivienne Wang and Juho Kannala and Joni Pajarinen},
journal= {arXiv preprint arXiv:2410.01539},
year = {2025}
}
备注
Accepted to ICLR 2025