中文

基于多模态上下文的语音语义解析

计算与语言 2024-06-11 v1 计算机视觉与模式识别 人机交互 机器学习 声音 音频与语音处理

摘要

我们提出了上下文环境中的语义解析(SPICE)任务,该任务通过将多模态输入与先前的上下文相结合,旨在增强人工智能体的上下文感知能力。SPICE超越了传统的语义解析,它提供了一个结构化、可解释的框架,用于用新信息动态更新智能体的知识,从而模拟人类交流的复杂性。我们开发了VG-SPICE数据集,旨在通过口语对话交流中的视觉场景图构建来挑战智能体,突出了语音和视觉数据的整合。我们还提出了为VG-SPICE设计的音频-视觉对话场景解析器(AViD-SP)。这些创新旨在改进多模态信息处理与整合。VG-SPICE数据集和AViD-SP模型均已公开提供。

关键词

引用

@article{arxiv.2406.06438,
  title  = {Multimodal Contextualized Semantic Parsing from Speech},
  author = {Jordan Voas and Raymond Mooney and David Harwath},
  journal= {arXiv preprint arXiv:2406.06438},
  year   = {2024}
}

备注

10 Pages, 3 figures, ACL 2024 Main