以视觉上下文增强对话系统实现和谐人机交互:综述
人工智能
2022-07-05 v1 人机交互
摘要
智能对话系统旨在以自然语言与人类和谐交流,在推动人工智能时代人机交互发展方面表现卓越。随着人机交互需求日益复杂(如多模态输入、时间敏感性),传统基于文本的对话系统难以满足更生动便捷的交互需求。因此,视觉上下文增强对话系统(VAD)能够通过感知和理解多模态信息(即图像或视频中的视觉上下文、文本对话历史)与人类交流,已成为主流研究范式。得益于视觉与文本上下文之间的一致性与互补性,VAD 具备生成引人入胜且上下文感知回复的潜力。为刻画 VAD 的发展,我们首先界定 VAD 的概念与独特特征,随后给出其通用系统架构以阐明系统工作流程。接着详细探讨若干研究挑战与代表性工作,并总结权威基准。最后,我们提出 VAD 的一些开放问题与有前景的研究趋势,例如跨模态对话语境下人机对话的认知机制,以及知识增强的跨模态语义交互。
引用
@article{arxiv.2207.00782,
title = {Enabling Harmonious Human-Machine Interaction with Visual-Context Augmented Dialogue System: A Review},
author = {Hao Wang and Bin Guo and Yating Zeng and Yasan Ding and Chen Qiu and Ying Zhang and Lina Yao and Zhiwen Yu},
journal= {arXiv preprint arXiv:2207.00782},
year = {2022}
}
备注
33pages, 4pages