多模态对话式 AI:数据集与方法综述
机器学习
2022-05-17 v1
摘要
作为人类,我们以全部感官或模态(声音、视觉、触觉、嗅觉与味觉)体验世界。我们利用这些模态,尤其是视觉与触觉,来传达与解读特定意义。多模态表达是对话的核心;丰富的模态集相互增强且常互为补偿。多模态对话式 AI 系统通过理解与以多模态表达自身来回答问题、完成任务并模拟人类对话。本文阐明了多模态对话研究目标的动机、定义与数学表述。我们提供了解决该目标所需研究的分类法:多模态表示、融合、对齐、翻译与协同学习。我们综述了各研究领域的 SOTA 数据集与方法,并强调其局限性假设。最后,我们指出多模态协同学习是多模态对话式 AI 研究中有前景的方向。
引用
@article{arxiv.2205.06907,
title = {Multimodal Conversational AI: A Survey of Datasets and Approaches},
author = {Anirudh Sundar and Larry Heck},
journal= {arXiv preprint arXiv:2205.06907},
year = {2022}
}
备注
17 pages, 1 figure, to be published in the 4th Workshop on NLP for Conversational AI