中文

刻画音频与视觉域情感的分形方法:跨模态交互研究

声音 2021-02-12 v1 计算与语言 音频与语音处理

摘要

已知听觉和视觉刺激均能在不同程度上传达人类心智中的情感。情感唤醒的强度或强度因所选刺激类型而异。在本研究中,我们尝试在涉及听觉和视觉刺激的跨模态情景中考察情感唤醒,同时研究其源特征。一种称为去趋势波动分析(DFA)及其二维类比的鲁棒分形分析技术,已被用于刻画三个(3)标准化音频和视频信号,量化其对应于正价和负价的标度指数。发现对应于两种不同模态的标度指数存在显著差异。去趋势互相关分析(DCCA)也被应用于解析各听觉与视觉刺激间的跨相关程度。这是首例提出一种新算法的同类研究,该算法仅利用源音频和视觉信号即可对跨模态情景中的情感唤醒进行分类,同时尝试建立它们之间的相关性。

关键词

引用

@article{arxiv.2102.06038,
  title  = {A Fractal Approach to Characterize Emotions in Audio and Visual Domain: A Study on Cross-Modal Interaction},
  author = {Sayan Nag and Uddalok Sarkar and Shankha Sanyal and Archi Banerjee and Souparno Roy and Samir Karmakar and Ranjan Sengupta and Dipak Ghosh},
  journal= {arXiv preprint arXiv:2102.06038},
  year   = {2021}
}