中文

MAQA:面向否定的多模态问答基准

计算与语言 2023-01-10 v1 人工智能 机器学习 声音 音频与语音处理

摘要

多模态学习可受益于预训练大语言模型(LLMs)的表征能力。然而,最先进的基于 transformer 的 LLM 常忽略自然语言中的否定,且目前尚无基准来定量评估多模态 transformer 是否继承了这一弱点。在本研究中,我们提出一个新的多模态问答(QA)基准,其改编自 AudioSet(Gemmeke 等,2017)中带标签的音乐视频,旨在系统评估多模态 transformer 能否执行复杂推理,将新概念识别为已学概念的否定。我们表明,采用标准微调方法时,无论模型规模如何,多模态 transformer 仍无法正确解释否定。然而,我们的实验证明,用否定 QA 样本扩充原始训练任务分布可使模型可靠地进行否定推理。为此,我们描述了一种新颖的数据生成流程,其提示 5400 亿参数的 PaLM 模型自动生成否定 QA 样本,作为易获取视频标签的组合。所生成的样本包含更自然的语言模式,且相较于基于模板的任务扩充方法收益显著。

关键词

引用

@article{arxiv.2301.03238,
  title  = {MAQA: A Multimodal QA Benchmark for Negation},
  author = {Judith Yue Li and Aren Jansen and Qingqing Huang and Joonseok Lee and Ravi Ganti and Dima Kuzmin},
  journal= {arXiv preprint arXiv:2301.03238},
  year   = {2023}
}

备注

NeurIPS 2022 SyntheticData4ML Workshop