中文

ToViLaG:您的视觉 - 语言生成模型也是一个作恶者

计算与语言 2023-12-20 v1 人工智能

摘要

警告:本文包含展示冒犯性内容的模型输出。最近,大规模视觉 - 语言生成模型(VLGMs)在多模态图像/文本生成方面取得了前所未有的进步。然而,这些模型也可能生成有毒内容,例如冒犯性文本和色情图像,从而引发重大的伦理风险。尽管已有大量关于语言模型有毒退化的研究,但在视觉 - 语言生成背景下,这一问题仍未得到充分探索。本研究深入探讨了各种 VLGMs 生成有毒内容的倾向以及对有毒数据的易感性。为此,我们构建了 ToViLaG 数据集,包含 3.2 万对协同有毒/单一有毒文本 - 图像对,以及 1000 条无害但具有诱发性的文本,这些文本倾向于激发毒性。此外,我们提出了 WInToRe,这是一种专为视觉 - 语言生成设计的新型毒性度量指标,理论上能够综合考虑输入和输出来反映毒性的不同方面。在此基础上,我们对多种多样的 VLGMs 进行了毒性基准测试,发现某些模型产生的危害比预期更大,而另一些则更容易受到感染,这突显了对 VLGMs 进行去毒化的必要性。因此,我们开发了一种创新的基于瓶颈的去毒化方法。该方法能够在保持可比生成质量的同时降低毒性,为这一研究方向提供了一个有希望的初步解决方案。

关键词

引用

@article{arxiv.2312.11523,
  title  = {ToViLaG: Your Visual-Language Generative Model is Also An Evildoer},
  author = {Xinpeng Wang and Xiaoyuan Yi and Han Jiang and Shanlin Zhou and Zhihua Wei and Xing Xie},
  journal= {arXiv preprint arXiv:2312.11523},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 (Main Conference), Oral Presentation