中文

BLIP-Adapter:面向移动端截图字幕生成的参数高效迁移学习

机器学习 2023-09-27 v1 计算与语言 计算机视觉与模式识别 人机交互

摘要

本研究旨在探索截图字幕生成任务的高效微调方法。近年来,图像字幕生成取得了显著进展,但针对移动端屏幕的字幕生成研究仍相对匮乏。当前描述产品截图中用户行为的数据集与用例明显有限。因此,我们试图为截图字幕生成任务微调已有预训练模型。然而,由于图像字幕模型参数量巨大,微调大型预训练模型耗时耗力,且需要大量计算与存储资源。为应对这一挑战,本研究提出一种适配器方法的组合,仅需在模型上微调附加模块。这些方法最初为视觉或语言任务设计,我们的意图是将它们应用于解决截图字幕生成中的类似难题。通过冻结图像字幕模型参数并仅训练与方法相关的权重,可在大幅减少参数量的同时取得与全模型微调相当的性能。本研究首次对截图字幕生成任务中组合适配器的有效性进行了全面探究。通过实验与分析,本研究旨在为适配器中视觉-语言模型的应用提供有价值的见解,并推动截图字幕生成高效微调技术的发展。我们的研究见 https://github.com/RainYuGG/BLIP-Adapter

关键词

引用

@article{arxiv.2309.14774,
  title  = {BLIP-Adapter: Parameter-Efficient Transfer Learning for Mobile Screenshot Captioning},
  author = {Ching-Yu Chiang and I-Hua Chang and Shih-Wei Liao},
  journal= {arXiv preprint arXiv:2309.14774},
  year   = {2023}
}