VELoRA:一种用于高效RGB-Event识别的低秩适配方法
计算机视觉与模式识别
2024-12-31 v1 人工智能
神经与进化计算
摘要
利用RGB和Event相机进行模式识别可以显著提升性能,通过部署利用细化策略的深度神经网络。鼓舞于大模型的成功应用,引入此类大模型也可进一步提升多模态任务的性能。然而,完全微调这些模型会导致效率低下,已提出轻量级微调方法如LoRA和Adapter以在效率和性能之间取得更好的平衡。鉴于目前尚无针对RGB-Event识别基于预训练基础模型进行参数高效微调(PEFT)的研究工作,本文提出了一种新颖的PEFT策略,用于适配预训练基础视觉模型以进行RGB-Event分类。具体而言,给定RGB帧和事件流,基于视觉基础模型ViT提取RGB和事件特征,采用模态特定的LoRA调优策略。还考虑了双模态帧差,以通过帧差主干网络捕获运动线索。这些特征被拼接并输入到高级Transformer层,通过模态共享LoRA调优实现高效的多模态特征学习。最后,将这些特征拼接并输入分类头以实现高效微调。源代码和预训练模型将发布于\url{https://github.com/Event-AHU/VELoRA}。
引用
@article{arxiv.2412.20064,
title = {VELoRA: A Low-Rank Adaptation Approach for Efficient RGB-Event based Recognition},
author = {Lan Chen and Haoxiang Yang and Pengpeng Shao and Haoyu Song and Xiao Wang and Zhicheng Zhao and Yaowei Wang and Yonghong Tian},
journal= {arXiv preprint arXiv:2412.20064},
year = {2024}
}
备注
In Peer Review