中文

基于早期退出和知识蒸馏的图像字幕生成:CAPEEN

计算机视觉与模式识别 2024-10-08 v1 人工智能 计算与语言

摘要

深度神经网络 (DNN) 在识别视觉元素和生成描述性文本方面取得了显著进展。然而,性能的提升往往伴随着计算负担和推理延迟的增加。早期退出 (EE) 策略可用于提高其效率,但在图像字幕任务中其适应性面临挑战,因为需要根据预测准确度的不同程度来获取不同的语义信息。为克服这一问题,我们引入 CAPEEN 以改进 EE 策略的性能,利用知识蒸馏。CAPEEN 在预测置信度超过训练数据中学习到的预定义阈值值后,即可在中间层完成推理。为考虑实际部署场景,其中目标分布可能与训练样本分布不同,我们引入了变体 A-CAPEEN,使用多臂老虎机框架动态调整阈值。在 MS COCO 和 Flickr30k 数据集上的实验表明,CAPEEN 相较于最终层可实现 1.77 倍的加速,同时保持竞争的性能;A-CAPEEN 还能对扭曲提供额外的鲁棒性。源代码已公开:https://github.com/Div290/CapEEN

关键词

引用

@article{arxiv.2410.04433,
  title  = {CAPEEN: Image Captioning with Early Exits and Knowledge Distillation},
  author = {Divya Jyoti Bajpai and Manjesh Kumar Hanawal},
  journal= {arXiv preprint arXiv:2410.04433},
  year   = {2024}
}

备注

To appear in EMNLP (finding) 2024