中文

LIPSFUS:用于唇读视听感官融合的神经形态数据集

声音 2023-04-04 v1 机器人学 音频与语音处理

摘要

本文提出了一个使用一组地址事件表示(Address-Event-Representation)传感器与工具、以精确时间同步采集的感官融合神经形态数据集。目标应用是面向多种机器学习应用(如数字、机器人指令以及丰富的辅助语音短词)的若干关键词唇读。该数据集还扩充了使用基于帧的相机采集的视听唇读数据集的脉冲版本。LIPSFUS 已公开可用,并已通过用于音频与视觉分类的深度学习架构进行了验证。它旨在用于基于人工与脉冲神经网络算法的感官融合架构。

关键词

引用

@article{arxiv.2304.01080,
  title  = {LIPSFUS: A neuromorphic dataset for audio-visual sensory fusion of lip reading},
  author = {Antonio Rios-Navarro and Enrique Piñero-Fuentes and Salvador Canas-Moreno and Aqib Javed and Jin Harkin and Alejandro Linares-Barranco},
  journal= {arXiv preprint arXiv:2304.01080},
  year   = {2023}
}

备注

Submitted to ISCAS2023, 4 pages, plus references, github link provided