Mettle:用于高效音视频适应的元Token学习
计算机视觉与模式识别
2025-07-01 v1
摘要
我们提出了一种名为Meta-Token Learning(Mettle)的简单且高效的方法,用于将大规模预训练变换模型适配到下游音视频任务。Mettle不按序修改变换模型背板的输出特征分布,而是利用轻量级的Layer-Centric Distillation(LCD)模块并行蒸馏变换模型每一层嵌入的完整音频或视觉特征到紧凑的元token中。这种蒸馏过程同时考虑了预训练知识的保留和任务特定的适应。获得的元token可直接应用于分类任务,如音视频事件定位和音视频视频解析。为进一步支持细粒度分割任务,如音视频分割,我们引入了Meta-Token Injection(MTI)模块,该模块利用来自顶层变换层的音频和视觉元token,以指导早期层中的特征适应。在多个音视频基准测试上的大量实验表明,我们的方法显著减少了内存使用和训练时间,同时保持参数效率和竞争性的准确性。
引用
@article{arxiv.2506.23271,
title = {Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation},
author = {Jinxing Zhou and Zhihui Li and Yongqiang Yu and Yanghao Zhou and Ruohao Guo and Guangyao Li and Yuxin Mao and Mingfei Han and Xiaojun Chang and Meng Wang},
journal= {arXiv preprint arXiv:2506.23271},
year = {2025}
}
备注
Technical Report