中文

探索音频线索以增强测试时视频模型自适应

计算机视觉与模式识别 2025-06-17 v1 机器学习 声音 音频与语音处理

摘要

测试时自适应(TTA)旨在通过在测试阶段进行自监督/无监督学习来提升训练模型的泛化能力。尽管大多数面向视频的现有TTA方法主要利用视觉监督信号,但它们往往忽略了固有音频数据的潜在贡献。为弥补这一空白,我们提出了一种将音频信息融入视频TTA的新方法。我们的方法利用音频丰富的语义内容生成音频辅助的伪标签,这在视频TTA的语境中是一个新概念。具体而言,我们提出了一种音频到视频标签映射方法:首先利用预训练的音频模型对从视频中提取的音频信号进行分类,然后通过大语言模型将基于音频的预测映射到视频标签空间,从而建立音频类别与视频标签之间的连接。为有效利用生成的伪标签,我们提出了一种灵活的自适应循环,根据不同视角下损失和一致性的变化,为每个样本确定最优的自适应迭代次数。这使得每个样本都能获得定制化的自适应过程。在两个广泛使用的数据集(UCF101-C和Kinetics-Sounds-C)以及两个新构建的音视频TTA数据集(AVE-C和AVMIT-C,包含多种失真类型)上的实验结果证明了该方法的优越性。我们的方法在不同视频分类模型上持续提升自适应性能,代表了将音频信息融入视频TTA的重要一步。代码:https://github.com/keikeiqi/Audio-Assisted-TTA。

关键词

引用

@article{arxiv.2506.12481,
  title  = {Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation},
  author = {Runhao Zeng and Qi Deng and Ronghao Zhang and Shuaicheng Niu and Jian Chen and Xiping Hu and Victor C. M. Leung},
  journal= {arXiv preprint arXiv:2506.12481},
  year   = {2025}
}

备注

14 pages, 7 figures