大型语言模型中的否定失聪:揭示图像生成中的 NO 综合征
计算与语言
2024-09-05 v2 人工智能
机器学习
摘要
基础大型语言模型(LLM)已改变我们对技术的感知方式。它们在诗歌创作、编码、作文生成和谜题解答等任务中表现出色。随着图像生成能力的融入,这些模型已成为更全面且多功能的 AI 工具。与此同时,研究者们正努力识别这些工具的局限性,以便进一步改进。目前已识别的缺陷包括幻觉、偏见以及绕过受限命令生成有害内容。本文中,我们识别了与大型语言模型图像生成能力相关的一种根本性局限,称其为 NO 综合征。这种否定失聪指的是 LLM 无法正确理解与否定相关的自然语言提示以生成所需图像。有趣的是,所有测试过的 LLM 包括 GPT-4、Gemini 和 Copilot 都受到了这种综合征的影响。为演示该局限的普遍性,我们进行了仿真实验,并对各种语言中的 LLM 进行了基于熵的基准统计分析测试,包括英语、印地语和法语。我们得出结论,NO 综合征是当前 LLM 中需要被解决的重要缺陷。本研究的相关发现表明,由于 NO 综合征,图像响应与文本响应之间存在持续的差异。我们认为,在 LLM 的文本响应与生成图像之间引入一种基于否定情境感知的强化学习反馈回路,可能有助于确保生成的文本基于 LLM 对否定查询的正确情境理解以及生成的视觉输出。
引用
@article{arxiv.2409.00105,
title = {Negation Blindness in Large Language Models: Unveiling the NO Syndrome in Image Generation},
author = {Mohammad Nadeem and Shahab Saquib Sohail and Erik Cambria and Björn W. Schuller and Amir Hussain},
journal= {arXiv preprint arXiv:2409.00105},
year = {2024}
}
备注
15 pages, 7 figures