基于多阶段SAM3特征融合的零样态客厅视频目标重识别
计算机视觉与模式识别
2026-05-27 v1
摘要
在客厅场景的镜像视频中进行目标重识别(ReID)具有挑战性,由于视角快速变化、频繁遮挡、杂乱场景以及大范围的类内外观差异。对象可能离开并重新进入视野,实例的多样性大且标注有限,使得监督式ReID难以扩展,从而动机了零样态方法。我们研究了在EPIC-Kitchens基准测试上的零样态目标ReID,其中目标是仅使用预训练的视觉特征匹配活跃的食物和厨房工具实例跨帧。我们首先评估了五种最先进的特征提取器,包括视觉语言模型(VLM)- CLIP、DINOv2、DreamSim、I-JEPA和SAM3,表明零样态方法失败,最佳基线仅达45.3%的mAP。我们随后提出了增强型SAM3 ReID管道,一个基于SAM3分割的零样态多阶段方法。阶段1使用SAM3抑制背景杂乱。阶段2将SAM3、DINOv2和CLIP的嵌入融合为单个L2归一化描述符。阶段3将余弦相似度与掩码形状IoU进行几何一致性增强,阶段4应用k-递归重排序。整个管道将性能提升至52.8%的mAP,提升了7.5%。
引用
@article{arxiv.2605.26383,
title = {Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion},
author = {Dmytro Klepachevskyi and Alexander Wong and Sirisha Rambhatla and Yuhao Chen},
journal= {arXiv preprint arXiv:2605.26383},
year = {2026}
}