基于多模态上下文的语音语义解析
计算与语言
2024-06-11 v1 计算机视觉与模式识别
人机交互
机器学习
声音
音频与语音处理
摘要
我们提出了上下文环境中的语义解析(SPICE)任务,该任务通过将多模态输入与先前的上下文相结合,旨在增强人工智能体的上下文感知能力。SPICE超越了传统的语义解析,它提供了一个结构化、可解释的框架,用于用新信息动态更新智能体的知识,从而模拟人类交流的复杂性。我们开发了VG-SPICE数据集,旨在通过口语对话交流中的视觉场景图构建来挑战智能体,突出了语音和视觉数据的整合。我们还提出了为VG-SPICE设计的音频-视觉对话场景解析器(AViD-SP)。这些创新旨在改进多模态信息处理与整合。VG-SPICE数据集和AViD-SP模型均已公开提供。
引用
@article{arxiv.2406.06438,
title = {Multimodal Contextualized Semantic Parsing from Speech},
author = {Jordan Voas and Raymond Mooney and David Harwath},
journal= {arXiv preprint arXiv:2406.06438},
year = {2024}
}
备注
10 Pages, 3 figures, ACL 2024 Main