中文

无记忆的音视频持续测试时适应

机器学习 2026-02-24 v1 声音

摘要

音视频持续测试时适应涉及在无标签非平稳域中持续适应源音视频模型,其中一个或两个模态可以分布性偏移,这会阻碍在线跨模态学习并导致性能下降。尽管已有工作针对该问题,但发现 SOTA 方法在持续参数更新后会出现灾难性遗忘,导致模型性能远低于源模型。在本工作中,我们首先表明,仅适应模态融合层不仅能提升该域的性能,还能增强后续域的性能。基于融合层参数的强跨任务可迁移性,我们提出一种方法 AV-CTTA\texttt{AV-CTTA},在不访问源数据的情况下提高模型的测试时性能。我们的方法通过选择性参数检索机制,从缓冲区仅使用小批量测试数据动态检索最佳融合层参数。这些参数随后被集成到模型中,适应当前测试分布,并为未来使用保存。广泛的实验在涉及单模态和双模态损坏的基准数据集上显示,我们提出的 AV-CTTA\texttt{AV-CTTA} 在显著最小化灾难性遗忘的同时显著优于现有方法。

关键词

引用

@article{arxiv.2602.18528,
  title  = {Audio-Visual Continual Test-Time Adaptation without Forgetting},
  author = {Sarthak Kumar Maharana and Akshay Mehra and Bhavya Ramakrishna and Yunhui Guo and Guan-Ming Su},
  journal= {arXiv preprint arXiv:2602.18528},
  year   = {2026}
}