中文

面向低资源视觉语言模型的令牌级动态门控机制

人工智能 2025-10-10 v1 计算与语言 机器学习

摘要

在认知学可理解的资源量下训练视觉语言模型,需要重新思考模型如何整合多模态信息。在宝宝语言挑战 2025 年的视觉轨道限制下,我们提出一种轻量级基于解码器的架构,包含 (1) 令牌级动态门控,用于自适应融合语言和视觉线索、(2) 特征调制和通道注意力,以最大化有限视觉信息的效用、以及 (3) 用于视觉对齐的辅助对比目标。评估结果显示,我们的方法在五个基准测试 (BLiMP、BLiMP 补充、EWoK、Winoground 和 VQA) 上表现出竞争甚至优于多模态基线。更值得注意的是,我们的动态门控发现了无需显式监督即可解读的模式,偏好内容词使用视觉线索、偏好功能词使用语言线索。尽管我们在挑战约束下识别出局限性,例如全局图像嵌入导致的信息瓶颈以及数据分割导致的训练不稳定,但我们的发现确立了动态门控作为高效多模态学习工具的强大潜力,即使在严苛约束下也能实现可解释性和性能。

关键词

引用

@article{arxiv.2510.08470,
  title  = {Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling},
  author = {Bianca-Mihaela Ganescu and Suchir Salhan and Andrew Caines and Paula Buttery},
  journal= {arXiv preprint arXiv:2510.08470},
  year   = {2025}
}

备注

Accepted to the EMNLP 2025 BabyLM Workshop