TB-AVA:以文本作为视听参数高效微调的语义桥梁
计算机视觉与模式识别
2026-05-14 v2
摘要
视听理解需要异构模态之间的有效对齐,然而当时间对齐的音频和视觉信号缺乏清晰的语义对应时,跨模态关联仍然具有挑战性。我们提出使用文本作为视听表征学习的语义锚点。为此,我们引入了一个基于冻结的音频和视觉编码器的参数高效适配框架,其核心是文本桥接视听适配器(TB-AVA),它实现了文本介导的音频流与视觉流之间的交互。在TB-AVA的核心,门控语义调制(GSM)根据文本推断的语义相关性选择性地调制特征通道。我们在多个基准上评估了所提出的方法,包括AVE、AVS和AVVP,其中所提出的框架达到了最先进的性能,证明了文本是视听学习中参数高效微调(PEFT)的有效语义锚点。
引用
@article{arxiv.2605.11572,
title = {TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning},
author = {Seongah Kim and Dinh Phu Tran and Hyeontaek Hwang and Saad Wazir and Duc Do Minh and Daeyoung Kim},
journal= {arXiv preprint arXiv:2605.11572},
year = {2026}
}
备注
12 pages, 6 figures