中文

基于元辅助学习与跨模态幻觉的视频高亮检测测试时适应

计算机视觉与模式识别 2025-08-08 v1

摘要

现有的视频高亮检测方法虽已进步,却难以在所有测试视频上获得良好泛化。这些方法通常为每个测试视频采用通用高亮检测模型,这种做法不佳,因为它未能考虑到单个测试视频的独特特征和变化。这些固定模型无法适应新型、未见的测试视频中所呈现的多样化内容、风格以及音视频质量,从而导致高亮检测性能下降。本文提出了Highlight-TTA—a用于视频高亮检测的测试时适应框架,通过动态适应模型以更好地与每个测试视频的特定特征匹配,从而提高泛化性和高亮检测性能。Highlight-TTA与一个辅助任务——跨模态幻觉——联合优化,同时针对主要的高亮检测任务。我们采用元辅助训练方案,使辅助任务能够有效驱动适应,同时增强主要任务。在测试阶段,我们利用该辅助任务对测试视频进行适应,以进一步提升其高亮检测性能。大量实验表明,在三个最先进的高亮检测模型和三个基准数据集上,引入Highlight-TTA后,模型性能均得到提升,取得优异成果。

关键词

引用

@article{arxiv.2508.04924,
  title  = {Test-Time Adaptation for Video Highlight Detection Using Meta-Auxiliary Learning and Cross-Modality Hallucinations},
  author = {Zahidul Islam and Sujoy Paul and Mrigank Rochan},
  journal= {arXiv preprint arXiv:2508.04924},
  year   = {2025}
}