TemporalDoRA:面向健全手术视频问答的时序PEFT
计算机视觉与模式识别
2026-03-11 v1
摘要
手术视频问答(VideoQA)需要在保持鲁棒性的同时实现准确的时间定位,由于医生对提问方式的自然差异,可能产生语言偏差。标准的参数高效微调(PEFT)方法仅针对预训练的投影进行适配,未能显式建模框架内的时间帧间相互作用,限制了其利用稀疏时序证据的能力。我们引入TemporalDoRA,一种视频特定的PEFT表述,扩展了权重分解低秩适应(Weight-Decomposed Low-Rank Adaptation)方法:(i)在视觉编码器的低秩瓶颈中插入轻量级时序多头注意力(MHA);(ii)仅对可训练低秩分支而非整个适配权重应用权重分解。这种设计既实现时序感知更新,又保持冻结的骨干网络和稳定的比例缩放。通过在适应子空间内跨帧混合信息,TemporalDoRA引导更新朝向时序一致的视觉线索,同时以最小的参数开销提升鲁棒性。为评估该设置,我们提出REAL-Colon-VQA,一个结肠镜VideoQA数据集,包含6,424个片段-问题对,包括配对的重新表述的Out-of-Template问题以评估对语言变体的敏感性。TemporalDoRA提升了Out-of-Template性能,消融实验确认时序混合在低秩分支内是这些提升的主要驱动因素。我们还在适配短片段的EndoVis18-VQA上进行验证,观察到在Out-of-Template分割上观察到一致的改进。代码和数据集已于\href{https://anonymous.4open.science/r/TemporalDoRA-BFC8/}{Anonymous GitHub}公开。
引用
@article{arxiv.2603.09696,
title = {TemporalDoRA: Temporal PEFT for Robust Surgical Video Question Answering},
author = {Luca Carlini and Chiara Lena and Cesare Hassan and Danail Stoyanov and Elena De Momi and Sophia Bano and Mobarak I. Hoque},
journal= {arXiv preprint arXiv:2603.09696},
year = {2026}
}