中文

利用大语言模型提升音视觉零样本学习

计算机视觉与模式识别 2024-04-25 v2

摘要

音视觉零样本学习旨在基于成对的音视觉序列识别未见类别。近期方法主要聚焦于学习与类名对齐的多模态特征,以增强对未见类别的泛化能力。然而,这些方法忽略了类名中晦涩的事件概念,并可能不可避免地引入具有困难训练目标的复杂网络结构。本文提出一个简洁而高效的框架,称为知识增强音视觉学习(KDA),其通过利用外部知识库帮助模型更有效地学习新颖事件内容。具体而言,我们首先提出利用大语言模型(LLMs)中包含的知识生成大量描述性句子,这些句子包含事件类别的重要区分性音视觉特征,有助于更好地理解未见类别。此外,我们提出一种知识感知自适应边界损失,以帮助区分相似事件,进一步提升对未见类别的泛化能力。大量实验结果表明,我们提出的 KDA 在三个流行的音视觉零样本学习数据集上优于当前最优(SOTA)方法。我们的代码将发布于 \url{https://github.com/chenhaoxing/KDA}。

关键词

引用

@article{arxiv.2311.12268,
  title  = {Boosting Audio-visual Zero-shot Learning with Large Language Models},
  author = {Haoxing Chen and Yaohui Li and Yan Hong and Zizheng Huang and Zhuoer Xu and Zhangxuan Gu and Jun Lan and Huijia Zhu and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2311.12268},
  year   = {2024}
}