中文

以视觉上下文增强对话系统实现和谐人机交互:综述

人工智能 2022-07-05 v1 人机交互

摘要

智能对话系统旨在以自然语言与人类和谐交流,在推动人工智能时代人机交互发展方面表现卓越。随着人机交互需求日益复杂(如多模态输入、时间敏感性),传统基于文本的对话系统难以满足更生动便捷的交互需求。因此,视觉上下文增强对话系统(VAD)能够通过感知和理解多模态信息(即图像或视频中的视觉上下文、文本对话历史)与人类交流,已成为主流研究范式。得益于视觉与文本上下文之间的一致性与互补性,VAD 具备生成引人入胜且上下文感知回复的潜力。为刻画 VAD 的发展,我们首先界定 VAD 的概念与独特特征,随后给出其通用系统架构以阐明系统工作流程。接着详细探讨若干研究挑战与代表性工作,并总结权威基准。最后,我们提出 VAD 的一些开放问题与有前景的研究趋势,例如跨模态对话语境下人机对话的认知机制,以及知识增强的跨模态语义交互。

关键词

引用

@article{arxiv.2207.00782,
  title  = {Enabling Harmonious Human-Machine Interaction with Visual-Context Augmented Dialogue System: A Review},
  author = {Hao Wang and Bin Guo and Yating Zeng and Yasan Ding and Chen Qiu and Ying Zhang and Lina Yao and Zhiwen Yu},
  journal= {arXiv preprint arXiv:2207.00782},
  year   = {2022}
}

备注

33pages, 4pages