VeS:让像素听从无监督教学
计算机视觉与模式识别
2025-07-30 v1
摘要
近期的密集音视频 (AV) 模型在检索和涌现局部化方面取得了令人印象深刻的成果,但几乎所有证据都来自以英语为中心、充满标题的网络视频。这些目标在低资源、代码切换和噪声多语言环境中是否仍然有效,尤其是典型于发展地区的环境,尚不明朗。我们发现它们确实有效——而且,聚合函数的选择在此背景下变得更为关键。使用覆盖数十种印度语言和方言变体的 Project Vaani 多语言子集,我们比较了三种对比目标:(i) 全局均值池化损失(CLIP 风格),(ii) 稠密 max-mean token 匹配器(DenseAV 风格),以及 (iii) 一种简单混合方案(灵感来自冻结视觉对齐策略)。稠密目标相较于全局池化实现了 +59% 的相对 R@1(音视频)提升,并显著降低了平均/中位数秩位,同时始终能够产生锐利的零样本局部化热图,无需对视觉主干进行任何调整(完全冻结,无 LoRA/部分微调)。我们的结果表明,稠密 token 路由并非高资源英语语料库的奢侈品;在注释稀缺和声学干净度不足的情境下,它更为关键。我们发布了代码和训练好的模型。
引用
@article{arxiv.2507.22008,
title = {VeS: Teaching Pixels to Listen Without Supervision},
author = {Sajay Raj},
journal= {arXiv preprint arXiv:2507.22008},
year = {2025}
}
备注
6 pages, 1 figure, 1 table. Code and models are released