中文

面向图像引导故事结尾生成任务的迭代对抗攻击

计算机视觉与模式识别 2024-01-24 v2 人工智能

摘要

多模态学习旨在开发能融合图像与文本等多源信息的模型。该领域中,多模态文本生成是处理多模态数据并输出文本的关键环节。图像引导故事结尾生成(IgSEG)是一项尤为重要的任务,目标在于理解文本与图像数据间的复杂关系并生成完整故事结尾。遗憾的是,作为近期 IgSEG 模型骨干的深度神经网络易受对抗样本攻击。现有对抗攻击方法主要聚焦于单模态数据,未针对利用跨模态信息的多模态文本生成任务进行分析。为此,我们提出一种迭代对抗攻击方法(Iterative-attack),融合图像与文本模态攻击,以更有效的迭代方式搜索对抗文本与图像。实验结果表明,所提方法优于现有单模态与非迭代多模态攻击方法,显示出提升多模态文本生成模型(如多模态机器翻译、多模态问答等)对抗鲁棒性的潜力。

关键词

引用

@article{arxiv.2305.13208,
  title  = {Iterative Adversarial Attack on Image-guided Story Ending Generation},
  author = {Youze Wang and Wenbo Hu and Richang Hong},
  journal= {arXiv preprint arXiv:2305.13208},
  year   = {2024}
}