中文

时序工作记忆:查询引导的片段细化以增强多模态理解

计算机视觉与模式识别 2025-02-11 v1 多媒体 声音 音频与语音处理

摘要

多模态基础模型 (MFM) 在视觉描述、问答和图像-文本检索等任务中取得了显著成功。然而,这些模型因其有限的内部容量而面临固有的局限性,这限制了它们处理扩展时序序列的能力,而这是全面视频和音频分析的关键要求。为了克服这些挑战,我们引入了一个专门的认知模块,即时序工作记忆 (TWM),旨在增强 MFM 的时序建模能力。它选择性地在时间维度上保留与任务相关的信息,确保在处理视频和音频内容的过程中保留关键细节。TWM 使用查询引导的注意力方法来关注时序序列中最具信息量的多模态片段。通过仅保留最相关的内容,TWM 优化了模型有限容量的使用,增强了其时序建模能力。这个即插即用模块可以轻松集成到现有的 MFM 中。借助我们的 TWM,九个最先进的模型在视频描述、问答和视频-文本检索等任务中表现出显著的性能提升。通过增强时序建模,TWM 扩展了 MFM 有效处理复杂、时间敏感数据的能力。我们的代码可在 https://github.com/xid32/NAACL_2025_TWM 获取。

关键词

引用

@article{arxiv.2502.06020,
  title  = {Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding},
  author = {Xingjian Diao and Chunhui Zhang and Weiyi Wu and Zhongyu Ouyang and Peijun Qing and Ming Cheng and Soroush Vosoughi and Jiang Gui},
  journal= {arXiv preprint arXiv:2502.06020},
  year   = {2025}
}

备注

Accepted at NAACL 2025