辅助多感官效果同步的双模态学习方法
人工智能
2018-05-01 v1 计算机视觉与模式识别
多媒体
摘要
在多感官媒体应用中,传统媒体内容(文本、图像、音频、视频等)可以与针对其他人类感官(如嗅觉、触觉、味觉)的媒体对象相关联。此类应用旨在通过传感器和执行器桥接虚拟与现实世界。执行器负责执行感官效果(如风、热、光),从而对用户产生感官刺激。在这些应用中,感官刺激必须与正在呈现的其他传统媒体内容及时同步。例如,当视听内容中呈现爆炸时,激活产生热和光的执行器可能是恰当的。通常使用某种声明式多媒体创作语言,将每个媒体对象的呈现时间戳与某些感官效果的执行相关联。这种设置下的一个问题在于,媒体对象与感官效果的同步是由应用程序的作者手动完成的,这是一个耗时且容易出错的过程。在本文中,我们提出了一种双模态神经网络架构,以辅助多感官媒体应用中的同步任务。我们的方法基于这样一个理念:可以同时使用音频和视频信号来识别应执行某些感官效果的时间戳。我们的学习架构结合了音频和视频信号来预测场景组件。出于评估目的,我们基于 Google 的 AudioSet 构建了一个数据集。我们提供了实验来验证我们的双模态架构。结果表明,与单模态架构的几种变体相比,双模态方法产生了更好的结果。
引用
@article{arxiv.1804.10822,
title = {A Bimodal Learning Approach to Assist Multi-sensory Effects Synchronization},
author = {Raphael Abreu and Joel dos Santos and Eduardo Bezerra},
journal= {arXiv preprint arXiv:1804.10822},
year = {2018}
}